Data Creation for RAG Optimization at HF-Space
AutoRAG HF-Space Tutorial #2. Data Creation
Data Creation for RAG Optimization at HF-Space
AutoRAG HF-Space Tutorial #2. Data Creation

0. Basic
For RAG pipeline optimization, we need Corpus data and QA data for evaluation.

AutoRAG Data Creation Process
We have 3 step parsing, chunking and QA creation.
- Parsed result:
Raw - Chunked result:
Corpus - QA Creation result:
QA
If you already have parsed results (=raw.parquet) or corpus data, uncheck the box to show a space for uploading files.


1. Parsing

🛠️ Note
To use llama parse and upstage, you need to get an API key and enter it.

2. Chunking
Chose chunking method and chunk parameters.

🛠️ Note

To use Semantic Chunking, we need an embedding model, so we need to put it in.
Embedding Model: OPENAI text-embedding-ada-002
3. QA Creation
3–1. Set OpenAI API Key

Select your language for QA data.
3–2. Run QA Creation

Sample Run QA Creation
4. Download your Corpus and QA
Don’t forget download created corpus and qa parquet file.

메타데이터
- post_id
- 9febc5853aa8
- slug
- data-creation-for-rag-optimization-at-hf-space-9febc5853aa8
- url
- https://medium.com/@autorag/data-creation-for-rag-optimization-at-hf-space-9febc5853aa8
- canonical_url
- https://medium.com/@autorag/data-creation-for-rag-optimization-at-hf-space-9febc5853aa8
- author_url
- https://medium.com/@autorag
- status
- ok
- fetched_at
- 2026-06-14 11:28:49