Jeder, der eine KI-Demo erlebt hat, kennt den Moment der Magie: Man stellt eine Frage, und in Sekunden kommt eine flüssige, kluge Antwort. Und jeder, der KI in den Geschäftsalltag gebracht hat, kennt den zweiten Moment: Dieselbe KI nennt mit derselben Souveränität eine Kundennummer, eine Vertragsklausel oder einen Lagerbestand, den es nie gegeben hat.
Bei einem Chatbot, der Gedichte schreibt, ist das eine Anekdote. Bei Geschäftsdaten ist es ein Haftungsrisiko. Vertrauen in ein System ist binär: Wer einmal eine erfundene Zahl in einem Reporting hatte, glaubt der nächsten richtigen Zahl auch nicht mehr.
Der wichtigste Satz vorweg, und er klingt unbequem: Ein Sprachmodell ist keine Datenbank. Es ist eine Wahrscheinlichkeitsmaschine für plausibel klingenden Text. Es optimiert auf "klingt richtig", nicht auf "ist richtig". Hat es zu einer Frage keine Fakten, füllt es die Lücke mit dem statistisch Naheliegenden, und das ist manchmal schlicht Fiktion. Genau das nennen wir Halluzination.
Die gute Nachricht: Man löst das Problem nicht, indem man auf das nächste, noch grössere Modell wartet. Man löst es mit Architektur. Zwei Bausteine tragen dabei die Hauptlast, RAG und MCP.
RAG: erst nachschlagen, dann antworten
RAG steht für Retrieval-Augmented Generation, frei übersetzt: Antworten mit vorgeschaltetem Nachschlagen. Statt die KI aus dem Gedächtnis raten zu lassen, durchsucht das System zuerst eine Wissensbasis aus Ihren eigenen Dokumenten, findet die passenden Stellen und legt sie der KI zusammen mit der Frage vor. Die KI formuliert ihre Antwort dann aus diesen mitgelieferten Fakten.
Das Bild dazu: kein Prüfling, der frei aus dem Kopf antwortet, sondern einer, der vor jeder Antwort kurz im richtigen Handbuch nachschlägt. Die Technik ist nicht neu, Forscher von Meta haben sie bereits 2020 beschrieben. Neu ist, wie selbstverständlich sie heute zum Standard für seriöse Unternehmens-KI gehört.
Wichtig: RAG liefert Wissen, lesend. Es weiss, was in Ihren Dokumenten steht. Es weiss nicht, wie der Kontostand eines Kunden gerade jetzt lautet. Dafür braucht es den zweiten Baustein.
MCP: die genormte Leitung zu Ihren Systemen
MCP steht für Model Context Protocol, ein offener Standard, den Anthropic Ende 2024 vorgestellt hat. Wenn RAG das Nachschlagen ist, dann ist MCP die Steckdose: eine einheitliche Leitung, über die eine KI mit Ihren Live-Systemen spricht, mit dem CRM, der Datenbank, dem ERP, dem Ticketsystem.
Der oft genutzte Vergleich ist "USB-C für KI". Früher brauchte jede Anbindung ihre eigene Speziallösung. MCP normt diesen Anschluss, und zwar in beide Richtungen: Die KI kann damit nicht nur aktuelle Daten lesen, sondern auch Aktionen auslösen. Dass inzwischen auch andere grosse Anbieter den Standard übernommen haben, macht ihn für eine strategische Entscheidung interessant. Es ist keine Wette auf einen einzelnen Hersteller.
Kurz: RAG bringt das geprüfte Wissen, MCP bringt den Live-Zugriff und die Handlungsfähigkeit. Damit beides verlässlich funktioniert, braucht es Sorgfalt an zwei Stellen.
Voraussetzung 1: eine Vektordatenbank, die wirklich trägt
Die Wissensbasis hinter RAG ist meist eine Vektordatenbank. Sie speichert Ihre Dokumente nicht als Text, sondern als "Bedeutungs-Koordinaten", damit das System nach Sinn suchen kann, nicht nur nach exakten Stichwörtern. Ob das gut funktioniert, entscheidet sich an wenigen, sehr praktischen Punkten:
Saubere, aktuelle Quellen. Garbage in, garbage out. Veraltete Dokumente müssen raus, sonst zitiert die KI souverän die Preisliste von vorletztem Jahr. Eine Aktualisierungs-Pipeline ist Pflicht, kein Nice-to-have.
Sinnvolle Zerteilung (Chunking). Dokumente werden in Stücke zerlegt. Zu gross, und die Suche ertrinkt im Rauschen. Zu klein, und der Zusammenhang geht verloren. Diese Stücke entlang von Bedeutung zu schneiden statt nach starrer Zeichenzahl ist einer der grössten Hebel für die Qualität.
Passende Embeddings. Das Modell, das Text in Bedeutung übersetzt, muss zu Ihrer Sprache und Ihrer Fachdomäne passen. Ein rein auf Englisch trainiertes Modell findet in deutschen Fachtexten weniger.
Hybride Suche. Reine Bedeutungssuche übersieht exakte Begriffe wie Artikelnummern oder Eigennamen. Die Kombination aus Bedeutungs- und Stichwortsuche liefert in der Praxis messbar bessere Trefferquoten.
Reranking. Ein zweiter, genauerer Durchgang sortiert die ersten Treffer nach echter Relevanz, bevor sie an die KI gehen.
Metadaten und Zugriffsrechte. Jedes Stück trägt mit, woher es stammt, wie alt es ist und wer es sehen darf. Gerade im Unternehmen entscheidend: Die KI darf einem Nutzer niemals etwas vorlegen, das er selbst nicht sehen dürfte.
Messbarkeit. Ob die Suche wirklich die richtigen Stellen findet, muss man messen, nicht hoffen. Ohne ein Test-Set aus echten Fragen bleibt Retrieval-Qualität Gefühlssache.
Verkürzt: RAG ist nur so gut wie die Suche darunter. Die meisten enttäuschenden KI-Projekte scheitern nicht am Modell, sondern an dieser Schicht.
Voraussetzung 2: MCP einführen, ohne die Tür offen zu lassen
In dem Moment, in dem die KI echte Geschäftssysteme berührt, ändert sich die wichtigste Frage. Sie lautet nicht mehr "Ist die Antwort schön", sondern "Wer darf hier eigentlich was". Der Leitsatz: Eine KI darf nie mehr Rechte haben als der Mensch, in dessen Auftrag sie handelt.
Technisch löst man das mit OAuth, dem etablierten Standard für delegierten Zugriff, den jeder schon erlebt hat, der irgendwo "mit Google anmelden" geklickt hat. Für KI gibt es dabei zwei typische Situationen:
Der Chat läuft in Ihrer Anwendung (Token Injection). Der Nutzer ist bereits angemeldet. Die Anwendung reicht diese geprüfte Identität an die KI weiter, und die KI erbt exakt die Rechte dieses Nutzers, nicht mehr und nicht weniger. Kein zweiter Login, und sie kann per Definition nichts sehen oder tun, was dem Nutzer selbst verwehrt ist.
Der Agent handelt autonom (Anmelde-Delegation). Hier ist im entscheidenden Moment kein Mensch dabei, etwa bei einem nächtlichen Auswertungslauf. Der Agent braucht deshalb ein eigenes, einmalig erteiltes Mandat: Ein Verantwortlicher erteilt ihm per ausdrücklicher Einwilligung einen klar umrissenen, jederzeit widerrufbaren Zugriff. Dasselbe Prinzip, mit dem Sie einer Dritt-App erlauben, in Ihrem Namen auf ein Postfach zuzugreifen. Der Agent bewegt sich danach nur innerhalb dieses Mandats.
Über beide Fälle hinweg gelten drei Prinzipien, die ein CTO von seinem Team einfordern sollte:
Geringste Rechte. Lesen, Schreiben und Löschen sind getrennte Stufen mit getrennter Freigabe. Ein Auswertungsagent braucht kein Löschrecht.
Einwilligung. Hinter jedem Zugriff steht eine bewusste, menschliche Freigabe, kein stillschweigender Durchgriff.
Nachvollziehbarkeit. Jede Aktion ist lückenlos zuordenbar: wer hat was, in wessen Auftrag, wann getan. Das ist der Unterschied zwischen einer schönen Demo und etwas, das Security und Compliance abnehmen.
Die Kombination: RAG plus MCP für belastbare Antworten
Getrennt sind beide nützlich. Zusammen werden sie zum eigentlichen Mittel gegen Halluzination, weil sie zwei verschiedene Lücken schliessen:
RAG liefert die Regeln und das Wissen. Was steht in unseren Verträgen, Richtlinien, Handbüchern.
MCP liefert die Fakten und die Handlung. Wie ist der Stand jetzt, im System, und führe bei Bedarf etwas aus.
Ein Beispiel, bewusst einfach gehalten: Eine Mitarbeiterin fragt den Assistenten, ob Kunde Müller auf einen höheren Tarif wechseln darf und wie sein aktueller Stand ist. RAG holt die geltende Tarif- und Vertragslogik aus der Wissensbasis, die Regel. MCP zieht live den realen Kontostand und die Vertragslaufzeit aus dem CRM, den Fakt, und könnte den Wechsel auf Wunsch gleich anstossen. Die Antwort steht damit auf zwei Beinen, der geltenden Regel und der aktuellen Realität, und jeder Schritt ist berechtigt und protokolliert.
Warum das die Halluzination einschnürt: Dem Modell bleibt kaum noch Raum, Lücken mit plausibler Fiktion zu füllen, weil die Lücken bereits mit nachgeschlagenem Wissen und Live-Daten gefüllt sind. Und weil jede Aussage auf eine Quelle oder einen Systemaufruf zurück zeigt, ist sie überprüfbar statt nur überzeugend.
Eine ehrliche Einschränkung gehört dazu: Das senkt Halluzination drastisch, es macht sie nicht mathematisch zu null. Ein Modell kann mitgelieferten Kontext immer noch falsch zusammenfassen. Deshalb bleiben die Leitplanken wichtig: Quellen in der Antwort sichtbar machen, bei unumkehrbaren Aktionen einen Menschen entscheiden lassen, und die Qualität laufend messen.
Fazit: ein Architektur-Thema, kein Modell-Thema
Halluzination bei Geschäftsdaten ist kein Makel, der sich durch Warten auf die nächste Modellgeneration von selbst erledigt. Sie ist eine Frage der Architektur.
Das Modell ist der Motor. RAG ist der Treibstoff aus geprüftem Wissen. MCP ist die kontrollierte Leitung in die reale Systemwelt. Und OAuth ist das Schloss an der Tür. Wer diese vier sauber zusammenbaut, bekommt eine KI, die nicht nur eloquent ist, sondern belastbar.
Für die Führungsebene verschiebt das die eigentliche Frage. Sie lautet nicht mehr "Welches Modell kaufen wir", sondern "Wie organisieren wir unser Wissen und unsere Zugriffe". Das ist die langlebigere Investition, denn sie überlebt jeden Modellwechsel, der ohnehin kommt.