rag-architect
Designs and implements production-grade RAG systems by chunking documents, generating embeddings, configuring vector stores, building hybrid search pipelines, applying reranking, and evaluating retrieval quality. Use when building RAG systems, vector databases, or knowledge-grounded AI applications
By jeffallan · 4,089 installs
npx skills add jeffallan/claude-skills --skill rag-architect
Source repository · Upstream listing
RAG Architect
Core Workflow
1. Requirements Analysis — Identify retrieval needs, latency constraints, accuracy requirements, and scale
2. Vector Store Design — Select database, schema design, indexing strategy, sharding approach
3. Chunking Strategy — Document splitting, overlap, semantic boundaries, metadata enrichment
4. Retrieval Pipeline — Embedding selection, query transformation, hybrid search, reranking
5. Evaluation & Iteration — Metrics tracking, retrieval debugging, continuous optimization
For each step, validate before moving on (see checkpoints below).
Reference Guide
Load detailed guidance based on context:
Topic Reference Load When
Vector Databases references/vector databases.md Comparing Pinecone, Weaviate, Chroma, pgvector, Qdrant
Embedding Models references/embedding models.md Selecting embeddings, fine tuning, dimension trade offs
Chunking Strategies references/chunking strategies.md Document splitting, overlap, semantic chunking
Retrieval Optimization references/retrieval optimization.md Hybrid search, reranking, query expansion, filtering
RAG Evaluation references/rag evaluation.md Metrics, evaluation frameworks, debugging retrieval
Implementation Examples
1. Chunking Documents
Checkpoint: assert all(c.metadata.get("source") for c in chunks), "Missing source metadata"
2. Generating Embeddings & Indexing
Checkpoint: assert qdrant.count("knowledge base").count == len(set(p.id for p in points)), "Deduplication failed"
3. Hybrid Search (Vector + BM25)
Checkpoint: assert len(hybrid search("test query", tenant id="demo")) 0, "Hybrid search returned no results"
4. Reranking Top K Results
Load provider API keys from environment variables or a secrets manager; never commit them to source code.
5. Retrieval Evaluation
Checkpoint: Target context precision = 0.7 and context recall = 0.6 before moving to LLM integration.
Constraints
MUST DO
Evaluate multiple embedding models on your domain data before committing
Implement hybrid search (vector + keyword) for production systems
Add metadata filters for multi tenant or domain specific retrieval
Measure retrieval metrics (precision@k, recall@k, MRR, NDCG)
Use reranking for top k results before passing context to LLM
Implement idempotent ingestion with deduplication (deterministic IDs)
Monitor retrieval latency and quality over time
Version embeddings and plan for model migration
MUST NOT DO
Use default chunk size (512) without evaluation on your domain data
Skip metadata enrichment (source, timestamp, section)
Ignore retrieval quality metrics in favor of only LLM output quality
Store raw documents without preprocessing/cleaning
Use cosine similarity alone for complex multi domain retrieval
Deploy without testing on production like data volumes
Forget to handle edge cases (empty results, malformed docs)
Couple the embedding model tightly to application code
Output Templates
When designing RAG architecture, deliver:
1. System architecture diagram (ingestion + retrieval pipelines)
2. Vector database selection with trade off analysis
3. Chunking strategy with examples and rationale
4. Retrieval pipeline design (query → results flow)
5. Evaluation plan with metrics, benchmarks, and pass/fail thresholds
[Documentation](https://jeffallan.github.io/claude skills/skills/data ml/rag architect/)