LRLearning RoadmapRead, build, evaluate
Modules

Module 04: RAG Engineering

Module 04: RAG Engineering Goal Build retrieval augmented generation systems that produce grounded answers with citations, access control, evaluation, and operational visibility. C

modules/04-rag-engineering/README.md1 min read

Module 04: RAG Engineering

Goal

Build retrieval-augmented generation systems that produce grounded answers with citations, access control, evaluation, and operational visibility.

Core Architecture

Documents -> Parsing -> Cleaning -> Chunking -> Embeddings -> Vector Store -> Retrieval -> Reranking -> Context Builder -> LLM -> Answer + Citations

Core Topics

  • Document parsing.
  • Cleaning and normalization.
  • Chunking strategies.
  • Semantic chunking.
  • Metadata design.
  • Embeddings.
  • Vector search.
  • Hybrid search.
  • Keyword search.
  • Reranking.
  • Query rewriting.
  • Context compression.
  • Retrieval evaluation.
  • Answer evaluation.
  • Hallucination detection.

Study Tasks

  • Parse PDF, DOCX, spreadsheet, HTML, and plain text documents.
  • Compare fixed-size chunking, heading-based chunking, and semantic chunking.
  • Create metadata filters.
  • Implement vector search.
  • Implement hybrid search.
  • Add citations.
  • Create an evaluation dataset.
  • Measure retrieval quality and answer faithfulness.

Project

Build projects/04-enterprise-rag-platform/.

Tips

  • Bad chunking creates bad answers.
  • Store source metadata from the beginning.
  • Retrieval quality should be measured before answer quality.
  • Keep access control outside the prompt; enforce it in retrieval and APIs.
  • PostgreSQL with pgvector.
  • Qdrant, Weaviate, Pinecone, Redis, or Elasticsearch/OpenSearch.
  • LlamaIndex or LangChain for comparison, not dependency lock-in.

Completion Checklist

  • Can explain RAG vs fine-tuning.
  • Can design chunking and metadata strategy.
  • Can evaluate retrieval precision and recall.
  • Can produce citation-backed answers.
  • Can protect restricted documents.