EvaluationsObservabilityZuverlässigkeitClean ArchitectureRAG
Ein Open-Source-RAG-System, das Fragen über einen großen, gemischten Korpus (Audio-Transkripte, PDFs, EPUBs) beantwortet, in dem eine selbstbewusst falsche oder unbelegte Antwort das Vertrauen sofort zerstört. Jede Antwort ist mit zitierten Quellen belegt, und die Antwortqualität wird gemessen, nicht geraten.
- Der Ansatz
- Die komplette Pipeline: Multi-Format-Ingestion, token-basiertes Chunking, Embeddings in PostgreSQL/pgvector, hybrides Retrieval (semantische und Keyword-Suche per Reciprocal Rank Fusion kombiniert, dazu Reranking), als Tools bereitgestellt für einen Pydantic-AI-Agenten, der Antworten streamt, die mit zitierten Quellpassagen belegt sind.
- Was es belegt
- Ein Evaluations-Framework mit LLM-as-judge-Scoring, einer eigenen Fehler-Taxonomie und Langfuse-Observability misst und verbessert die Antwortqualität iterativ, statt zu raten. Jede Antwort ist mit zitierten Quellen belegt.
- Highlights
- Zitierte Quellen bei jeder Antwort
- LLM-as-judge-Eval-Harness und Fehler-Taxonomie
- Hybrides Retrieval: RRF plus Reranking
- Langfuse-Observability
- Stack
- LLM integrationRAG (pgvector + full-text search)Voyage AI embeddings + rerankingEvaluation harnessLLM-as-judgeContext engineeringInstructorPydantic AIOpenRouter APILangfusePythonFastAPIPostgreSQLDocker
Einen Prozess automatisieren oder ein KI-Feature ausliefern?
Ob manuelle Arbeit zwischen Tools, die sich von selbst erledigen sollte, oder ein KI-Produkt, das zuverlässig in Produktion muss: Ich bringe es vom Audit bis zur robusten, gut getesteten Umsetzung, allein oder gemeinsam mit deinem Team.