rag-architect

Designs and implements production-grade RAG systems by chunking documents, generating embeddings, configuring vector stores, building hybrid search pipelines, applying reranking, and evaluating retrieval quality. Use when building RAG systems, vector databases, or knowledge-grounded AI applications

By jeffallan · 4,089 installs

npx skills add jeffallan/claude-skills --skill rag-architect

Source repository · Upstream listing

RAG Architect Core Workflow 1. Requirements Analysis — Identify retrieval needs, latency constraints, accuracy requirements, and scale 2. Vector Store Design — Select database, schema design, indexing strategy, sharding approach 3. Chunking Strategy — Document splitting, overlap, semantic boundaries, metadata enrichment 4. Retrieval Pipeline — Embedding selection, query transformation, hybrid search, reranking 5. Evaluation & Iteration — Metrics tracking, retrieval debugging, continuous optimization For each step, validate before moving on (see checkpoints below). Reference Guide Load detailed guidance based on context: Topic Reference Load When Vector Databases references/vector databases.md Comparing Pinecone, Weaviate, Chroma, pgvector, Qdrant Embedding Models references/embedding models.md Selecting embeddings, fine tuning, dimension trade offs Chunking Strategies references/chunking strategies.md Document splitting, overlap, semantic chunking Retrieval Optimization references/retrieval optimization.md Hybrid search, reranking, query expansion, filtering RAG Evaluation references/rag evaluation.md Metrics, evaluation frameworks, debugging retrieval Implementation Examples 1. Chunking Documents Checkpoint: assert all(c.metadata.get("source") for c in chunks), "Missing source metadata" 2. Generating Embeddings & Indexing Checkpoint: assert qdrant.count("knowledge base").count == len(set(p.id for p in points)), "Deduplication failed" 3. Hybrid Search (Vector + BM25) Checkpoint: assert len(hybrid search("test query", tenant id="demo")) 0, "Hybrid search returned no results" 4. Reranking Top K Results Load provider API keys from environment variables or a secrets manager; never commit them to source code. 5. Retrieval Evaluation Checkpoint: Target context precision = 0.7 and context recall = 0.6 before moving to LLM integration. Constraints MUST DO Evaluate multiple embedding models on your domain data before committing Implement hybrid search (vector + keyword) for production systems Add metadata filters for multi tenant or domain specific retrieval Measure retrieval metrics (precision@k, recall@k, MRR, NDCG) Use reranking for top k results before passing context to LLM Implement idempotent ingestion with deduplication (deterministic IDs) Monitor retrieval latency and quality over time Version embeddings and plan for model migration MUST NOT DO Use default chunk size (512) without evaluation on your domain data Skip metadata enrichment (source, timestamp, section) Ignore retrieval quality metrics in favor of only LLM output quality Store raw documents without preprocessing/cleaning Use cosine similarity alone for complex multi domain retrieval Deploy without testing on production like data volumes Forget to handle edge cases (empty results, malformed docs) Couple the embedding model tightly to application code Output Templates When designing RAG architecture, deliver: 1. System architecture diagram (ingestion + retrieval pipelines) 2. Vector database selection with trade off analysis 3. Chunking strategy with examples and rationale 4. Retrieval pipeline design (query → results flow) 5. Evaluation plan with metrics, benchmarks, and pass/fail thresholds [Documentation](https://jeffallan.github.io/claude skills/skills/data ml/rag architect/)