Hybrid-RAG und Reranking statt naiver Vektorsuche
Chunking nach Zeichenzahl, nur Vektoren, kein Reranking: naives Retrieval. Halluzinationen sind dann kein Zufall.
Der ältere Text RAG-Pipeline mit LangChain und Milvus beschreibt genau diesen Pfad aus einem Gesundheitsprojekt. Als Diagnose nützlich. Als Rezept gefährlich. Hier steht, was danach kommen muss.
Was naiv heißt
chunk_size und overlap, ohne Rücksicht auf Überschriften oder TabellenIn dem Projekt lagen 500+ Videos und PDFs in Milvus, grob 50.000 Chunks, Antworten unter 100 ms. Schnell. Nicht dasselbe wie richtig. Revision fragt nach der Stelle, nicht nach der Latenz.
Was Hybrid ändert
Keyword-Suche findet Normnummern, Aktenzeichen, Produktcodes. Vektoren finden Paraphrasen. Zusammen, dann ein Reranker, der die Reihenfolge nach der Frage sortiert. Erst dann darf ein Chunk ins Prompt.
Ohne Reranker gewinnt oft der lauteste Nachbar, nicht die Stelle.
Was Quellenbindung verlangt
Auch Hybrid-RAG ist nur Retrieval. Quellenbindung verlangt: keine Aussage ohne öffenbaren Beleg. Der Reranker senkt die Fehlerquote. Die Regel stoppt die Lücke.
Was der Check daraus macht
Tag 2 im LLM-Readiness-Check ist Retrieval und Quellenbindung. Ich schaue, ob nur Vektoren laufen und ob ein Mensch den Chunk öffnen kann.
Verwandt: Evaluation, Mandantentrennung. Leistung: KI-Engineering. Praxis: Gesundheits-Chatbot.
Verwandte Artikel
Mandantentrennung für RAG und Agenten
Ein Pilot für einen Kunden ist kein Produkt für zwanzig. Was Mandantentrennung in RAG- und Agentensystemen konkret heißt.
Artikel lesenLLM-Halluzinationen sind ein Compliance-Problem
Wenn ein Modell Belege erfindet, stoppt Revision das Projekt. LLM Nachvollziehbarkeit braucht Quellenbindung, nicht einen besseren Prompt.
Artikel lesenTermin
30 Minuten. Wenn der Use-Case nicht in den Betrieb kann, sage ich das.