LLM-Halluzinationen sind ein Compliance-Problem
Die Demo läuft. Das Modell klingt sicher. Dann fragt die Rechtsabteilung: Woher stammt Satz drei? Und niemand kann es zeigen.
Das ist der Punkt, an dem KI-Projekte in regulierten Häusern sterben. Nicht am Modell. An fehlender Quellenbindung.
Was Halluzination hier bedeutet
Das Modell liefert einen Absatz, der sich liest wie aus der Norm. Die Normstelle existiert nicht. Oder sie existiert, sagt aber etwas anderes. In einem Chat über Rezepte ist das ärgerlich. In einem Audit-Finding oder in einer Patienteninformation ist das ein Fall für Compliance.
Ich sehe das regelmäßig. Teams optimieren den Prompt. Die Quote sinkt ein bisschen. Die Frage der Rechtsabteilung bleibt dieselbe: Können Sie die Aussage belegen?
Quellenbindung, nicht Bauchgefühl
RAG allein reicht nicht. Eine Vektorsuche holt ähnliche Chunks. Ähnlich ist nicht belegt.
Was ich in Projekten brauche:
Klingt simpel. In der Praxis fehlt oft Punkt 2. Das Modell füllt Lücken, weil der Prompt „sei hilfreich“ lautet. Hilfreich ohne Beleg ist in einem Audit das Gegenteil.
Warum Prompt-Tuning das nicht löst
Sie können dem Modell verbieten zu raten. Es rät trotzdem, nur höflicher. Ohne Retrieval-Schicht mit harter Regel (keine Quelle, keine Aussage) bleibt das ein Wunsch.
Evaluation macht den Rest sichtbar. Ein Prompt- oder Modellwechsel kann die Halluzinationsrate verdoppeln. Wenn niemand misst, merkt es erst der Auditor.
Was ich in so einem Review prüfe
Das ist LLM Nachvollziehbarkeit. LangGraph oder LangChain sind dabei Werkzeug. Die Regel sitzt im Ablauf: holen, prüfen, dann erst formulieren.
Für wen das zählt
Wer eine Demo bauen will, braucht das nicht. Wer live gehen will und Revision im Haus hat, braucht es vor dem Rollout. Genau dort entsteht der Kauf. „KI Halluzinationen Compliance“ ist keine SEO-Phrase, das ist der Satz, den ich in Gesprächen höre.
Wenn Sie an der Stelle stehen: der LLM-Readiness-Check ist fünf Tage, schriftlich, ohne Kaufzwang für das Folgeprojekt.
Verwandte Artikel
Hybrid-RAG und Reranking statt naiver Vektorsuche
Chunking nach Zeichenzahl und reine Vektorsuche erzeugen erwartbare Halluzinationen. Was Hybrid-Suche und Reranking ändern, und was der ältere RAG-Artikel falsch lehrt.
Artikel lesenLLM-Evaluation in Produktion
Ein Prompt- oder Modellwechsel verschlechtert die Qualität. Niemand merkt es, wenn Evaluation fehlt. Was ich in regulierten LLM-Projekten messe.
Artikel lesenTermin
30 Minuten. Wenn der Use-Case nicht in den Betrieb kann, sage ich das.