Der Instandhalter steht an der Linie, der Füller FL-200 meldet Fehler E-217. Er fragt den Assistenten: „Gab es das schon einmal und was hat geholfen?“ Die Antwort kommt schnell und klingt sicher. Sie erklärt allgemein, wie Fehlercodes an Abfüllanlagen entstehen, verweist auf ein Kapitel im Handbuch und endet dort. Der Servicebericht vom Frühjahr, in dem genau dieser Fehler steht und die Lösung („Sensor am Einlauf neu justiert“), taucht nicht auf. Er liegt im Index. Die Suche hat ihn nur nicht gefunden.
Das Beispiel ist erfunden, wie alle Dokumente in diesem Artikel. Das Muster dahinter ist es nicht. Das Sprachmodell hat in diesem Fall nichts falsch gemacht: Es hat aus den Stücken, die man ihm vorgelegt hat, eine ordentliche Antwort gebaut. Falsch waren die Stücke. Genau hier entsteht in der Praxis der größte Teil der Enttäuschungen mit Unternehmens-KI, und genau hier schaut selten jemand hin, weil der Fehler unsichtbar ist. Eine schlechte Antwort sieht aus wie eine schlechte Antwort. Dass die richtige Stelle nie bei dem Modell ankam, sieht man ihr nicht an.
Unsere These in diesem Artikel: Die Qualität einer Unternehmenssuche entscheidet sich in fünf Entscheidungen vor dem Sprachmodell. Jede einzelne ist verständlich, jede kann scheitern, und jede lässt sich prüfen, auch ohne Informatikstudium. Wer sie kennt, kann Anbieter besser befragen und die eigenen Daten besser vorbereiten.
Warum die Suche wichtiger ist als das Modell
Ein Sprachmodell kennt Ihre Dokumente nicht. Es kennt Ihren Rahmenvertrag mit dem Transportpartner nicht, das Abnahmeprotokoll der Abfüllanlage nicht und die Servicehistorie des Füllers nicht. Damit es trotzdem aus Ihrem Wissen antworten kann, schaltet man eine Suche davor. Sie holt die passenden Stellen und legt sie dem Modell zusammen mit der Frage vor. Das Modell formuliert daraus die Antwort. Dieses Vorgehen heißt in der Fachsprache Retrieval-Augmented Generation, kurz RAG.
Daraus folgt eine einfache Rechnung: Das Modell kann nur so gut antworten wie die Stücke, die es bekommt. Fehlt die entscheidende Stelle, gibt es zwei schlechte Ausgänge. Im besseren Fall sagt das Modell, dass es nichts gefunden hat. Im schlechteren Fall füllt es die Lücke mit etwas Plausiblem. Beides hat dieselbe Ursache, und beide lassen sich nicht durch ein größeres Modell beheben.
Gedankenexperiment: Sie geben einem sehr guten Juristen eine Akte, aus der man die wichtigste Seite vorher entnommen hat. Er wird sorgfältig arbeiten und trotzdem zu einem falschen Ergebnis kommen. Die Sorgfalt war nicht das Problem.
Die Kette in fünf Stationen
Von der Datei bis zur Antwort durchläuft ein Dokument fünf Stationen. Die Grafik zeigt sie nebeneinander, darunter die beiden Schichten, die quer dazu liegen: der Index, der Inhalt und Zugriffsliste gemeinsam hält, und der Berechtigungsfilter.
Im Einzelnen:
- Aufteilen: Das Dokument wird in Stücke geschnitten, weil man nie ein ganzes Dokument suchen oder dem Modell vorlegen will, sondern die eine Stelle darin.
- Einbetten: Jedes Stück wird in eine Zahlenfolge umgerechnet, die seine Bedeutung abbildet. Ähnliche Bedeutung ergibt ähnliche Zahlen.
- Suchen: Eine Stichwortsuche und eine Bedeutungssuche liefern je eine Liste von Kandidaten, die zu einer Liste zusammengeführt werden.
- Neu ordnen: Die besten Kandidaten werden noch einmal genauer geprüft und sortiert. Nur die ersten wenigen gehen an das Modell.
- Antworten mit Quellen: Das Modell formuliert die Antwort und nennt, aus welchen Stücken sie stammt, damit man es nachprüfen kann.
Quer dazu gilt: Was eine Person nicht lesen darf, darf auch ihre Antwort nicht beeinflussen. Dazu gleich mehr. Zuerst zu den Stationen, an denen die meisten Suchen stolpern.
Station 1: Dokumente aufteilen
Warum überhaupt aufteilen? Aus drei praktischen Gründen. Ein Modell kann nur eine begrenzte Textmenge auf einmal lesen. Ein einzelner Bedeutungswert für ein ganzes Dokument wäre so grob, dass er nichts mehr unterscheidet. Und der Beleg unter der Antwort soll auf eine Stelle zeigen, nicht auf 40 Seiten.
Die Frage ist deshalb nicht, ob man schneidet, sondern wo. Zu kleine Stücke verlieren ihren Zusammenhang. Zu große Stücke verwässern ihn.
| Stückgröße | Typisches Symptom | Beispiel (fiktiv) |
|---|---|---|
| Zu klein (ein einzelner Satz) | Die Zahl ist gefunden, aber niemand weiß, wofür sie steht | „34 Minuten“ steht allein in einem Stück, die Überschrift „Formatwechsel“ in einem anderen |
| Passend (ein zusammenhängender Gedanke) | Stück ist für sich lesbar und auf eine Frage zugeschnitten | Absatz zum Formatwechsel mit Vereinbarung und Messwert |
| Zu groß (ganzer Abschnitt oder Kapitel) | Die Bedeutung ist ein Durchschnitt über viele Themen, die Antwort geht unter | Ein Kapitel von 40 Seiten, in dem der Formatwechsel einen Absatz einnimmt |
Struktur schlägt feste Länge
Der naheliegende Ansatz ist, alle Dokumente nach einer festen Zeichenzahl zu zerschneiden. Er ist einfach und liefert brauchbare Ergebnisse bei gleichförmigem Fließtext. Bei Unternehmensdokumenten versagt er schnell, weil sie nicht gleichförmig sind. Sie haben Überschriften, Tabellen, Fußnoten, Anhänge. Eine feste Länge schneidet mitten durch eine Tabelle oder trennt eine Überschrift vom ersten Absatz darunter.
Besser ist es, an der Struktur entlang zu schneiden: an Überschriften und Absätzen, bei Tabellen zeilenweise, aber mit der Kopfzeile in jedem Stück. Ein Beispiel aus dem fiktiven Abnahmeprotokoll zum Projekt P-2291: Die Zeile „Nennleistung bei 500 ml, 10.000 Flaschen pro Stunde vereinbart, 10.240 gemessen“ ist nur mit ihren Spaltenköpfen verständlich. Ohne sie ist es eine Zahl neben einer Zahl. Dazu kommt eine kleine Überlappung zwischen benachbarten Stücken, damit ein Gedanke, der über eine Schnittstelle hinweggeht, in mindestens einem Stück vollständig vorkommt.
Ob das gelungen ist, sieht man nicht von außen. Man sieht es, wenn man sich die Stücke ausgeben lässt und einige davon liest, als wäre man die Suche: Versteht man jedes Stück, ohne das Dokument zu kennen? Wenn nicht, versteht es die Suche auch nicht.
Station 2: Einbetten, oder: Bedeutung als Koordinaten
Ein Einbettungsmodell liest ein Stück Text und gibt eine lange Zahlenfolge zurück, einen Vektor. Man kann ihn sich als Koordinate auf einer Landkarte der Bedeutungen vorstellen. Stücke, die Ähnliches sagen, liegen nah beieinander, Stücke über andere Themen weit entfernt. Die Frage wird auf dieselbe Weise in eine Koordinate umgerechnet, und die Suche liefert die Stücke, die ihr am nächsten liegen.
Der große Vorteil: Es kommt nicht auf dieselben Wörter an. Wer nach der „Kündigungsfrist“ fragt, findet auch den Absatz, der von der „Frist zur Beendigung des Vertrags“ spricht. Eine reine Stichwortsuche würde ihn verfehlen.
Die Schwäche liegt im Gegenstück: Bedeutung ist unscharf. Das Modell erkennt, dass „Fehler E-217 am Füller FL-200“ in die Gegend „Störung an einer Abfüllanlage“ gehört, aber die genaue Kennung E-217 ist für die Landkarte nur eine Ziffernfolge unter vielen. Kennungen, Artikelnummern, seltene Eigennamen und Zahlen sind genau das, was Bedeutungssuche am schlechtesten festhält. Im Eingangsbeispiel lag hier der erste Teil des Fehlers.
Fehlender Kontext: das Stück ohne Absender
Der zweite Teil lag im Stück selbst. Stellen Sie sich im fiktiven Rahmenvertrag mit dem Transportpartner TP-118 den Satz vor: „Die Frist beträgt 30 Tage.“ Gespeichert als eigenes Stück ist er wertlos. Welche Frist? In welchem Vertrag? Das Stück weiß es nicht, und die Landkarte kann es nicht wissen. Es liegt irgendwo bei „Fristen“, gemeinsam mit Tausenden Sätzen aus anderen Verträgen.
Die Abhilfe ist unspektakulär und wirksam: Vor dem Einbetten bekommt jedes Stück eine Kontextzeile mit dem Dokumenttitel, dem Abschnitt und, wo es sinnvoll ist, dem Datum. Aus dem Satz wird „Rahmenvertrag TP-118, Kündigung: Die Frist beträgt 30 Tage.“ Jetzt ist er eindeutig zuordenbar, und dieselbe Zeile kann später im Quellenverweis erscheinen.
Ein Wort zum Datenschutz, weil die Frage regelmäßig kommt: Einbettungen sind nicht automatisch anonym. Behandeln Sie Vektoren so wie die Dokumente, aus denen sie entstanden sind. Läuft die Einbettung bei einem externen Dienstleister, ist das in der Regel eine Auftragsverarbeitung nach Art. 28 DSGVO, die vertraglich geregelt sein muss. Bei TheroAI liegt die Datenhaltung in Deutschland, die KI-Verarbeitung findet in der EU statt. Das ist keine Rechtsberatung, klären Sie den Einzelfall mit Ihrer Rechtsberatung.
Station 3: Stichwort und Bedeutung kombinieren
Die Stichwortsuche ist älter und unmodisch, und sie hat eine Stärke, die der Bedeutungssuche fehlt: Sie nimmt Wörter wörtlich. Wer „E-217“ eintippt, bekommt Stellen, an denen genau „E-217“ steht. Ein gängiges Verfahren dafür heißt BM25. Es bewertet, wie oft ein Suchwort in einem Stück vorkommt und wie selten es im gesamten Bestand ist. Seltene Wörter wie eine Fehlernummer zählen dabei mehr als häufige wie „Fehler“.
Die Bedeutungssuche hat die umgekehrte Stärke. Sie findet Umschreibungen, Synonyme und Formulierungen aus einer anderen Abteilung. Beide Verfahren haben also Lücken, nur an verschiedenen Stellen. Deshalb kombinieren moderne Unternehmenssuchen beide. Man nennt das hybride Suche. Auch die Suche in TheroAI arbeitet so: Stichwort und Bedeutung laufen nebeneinander.
Abkürzungen und Schreibweisen
Gerade die Abkürzungen sind die Stolperstelle im Betriebsalltag. Jedes Unternehmen hat eigene Kürzel, die nirgends erklärt sind. Der Vertrieb schreibt „SLA“, der Vertrag sagt „Service-Level-Vereinbarung“. Eine Anlage heißt im Lastenheft „Abfüllanlage“, im Servicebericht „Füller“. Die Kennung schreibt einer „E-217“, der nächste „E217“, ein Dritter „E 217“. Für die Suche sind das drei verschiedene Wörter.
Dagegen helfen drei Dinge, die zusammenspielen: eine Normalisierung der Schreibweisen vor dem Indexieren, eine Liste von Abkürzungen und Synonymen, die Sie selbst pflegen, und die Kontextzeile aus Station 2, die ein Kürzel oft schon in ausgeschriebener Form enthält. Keine der drei ist Magie, alle drei sind Handarbeit, die sich auszahlt.
Zwei Listen werden eine
Stichwortsuche und Bedeutungssuche liefern je eine Rangliste mit eigenen Punktwerten, die man nicht direkt vergleichen kann. Ein gängiger Ausweg ist, nicht die Punkte zu mischen, sondern die Plätze. Das Verfahren heißt Reciprocal Rank Fusion. Jede Liste vergibt für einen Platz einen Wert von 1 geteilt durch (60 plus Platz), und die Werte aus beiden Listen werden addiert. Der Wert 60 ist eine übliche Voreinstellung und dient dazu, dass Platz 1 nicht überproportional dominiert.
Das Entscheidende an dem Verfahren: Wer in beiden Listen halbwegs weit vorn liegt, schlägt den, der nur in einer Liste ganz vorn liegt. Eine Beispielrechnung mit drei Dokumenten zeigt es.
| Dokument | Platz Stichwortsuche | Platz Bedeutungssuche | Punkte (mal 1.000) |
|---|---|---|---|
| B | 3 | 2 | 32,0 |
| A | 1 | 40 | 26,4 |
| C | 2 | nicht in der Liste | 16,1 |
Dokument A führt die Stichwortliste an, landet aber hinter B, weil die Bedeutungssuche es erst auf Platz 40 sieht. Dokument C kommt nur in einer Liste vor und liegt entsprechend zurück. Die Zahlen sind eine Beispielrechnung mit Annahmen, keine Messung.
Station 4: Treffer neu ordnen
Nach der Fusion liegt eine Liste von Kandidaten vor, grob sortiert. Grob heißt: Die Verfahren davor vergleichen Frage und Stück nur indirekt. Die Stücke wurden irgendwann vorab in Koordinaten umgerechnet, die Frage wird erst jetzt umgerechnet, und beide treffen sich nur über ihren Abstand. Das ist schnell, aber ungenau.
Ein Reranker arbeitet anders. Er liest Frage und Stück gemeinsam, so wie ein Mensch beide nebeneinander legen würde, und bewertet, ob das Stück die Frage wirklich beantwortet. Das ist deutlich genauer und deutlich teurer, weil es für jedes Paar einzeln geschehen muss und sich nicht im Voraus berechnen lässt. Deshalb wendet man es nur auf eine kleine Menge an: auf die besten Kandidaten der Fusion, nicht auf den ganzen Bestand.
Der Trichter zeigt die Größenordnungen einer Beispielrechnung. Die Annahmen stehen offen in der Tabelle.
| Stufe | Beispielwert (Annahme) | Was dort geschieht |
|---|---|---|
| Index | 200.000 Stücke | Alle eingelesenen Stücke aller Quellen |
| Nach Berechtigungsfilter | 60.000 Stücke | Nur Stücke, die diese Person lesen darf |
| Nach Suche und Fusion | 50 Kandidaten | Stichwort und Bedeutung, zusammengeführt |
| Nach Neu ordnen | 5 Stücke | Frage und Stück gemeinsam bewertet |
Der Wert des Rerankers zeigt sich in den Fällen, in denen die Fusion zwei fast gleich gute Kandidaten liefert. Auf Platz 3 steht dann zum Beispiel das Handbuchkapitel, das den Fehlercode nur allgemein erklärt, auf Platz 9 der Servicebericht mit der konkreten Lösung. Ein Reranker, der die Frage „Gab es das schon einmal und was hat geholfen?“ mit beiden Stücken zusammen liest, erkennt, dass nur der Bericht diese Frage beantwortet, und schiebt ihn nach vorn. Ohne diesen Schritt hätte der Servicebericht das Modell womöglich nie erreicht, weil nur die ersten Plätze weitergegeben werden.
Berechtigungen: der Filter gehört vor das Ranking
Die fünfte Entscheidung ist keine Station, sondern eine Regel für alle: Wer eine Antwort bekommt, darf nur aus Stücken beantwortet werden, die er lesen darf. Entscheidend ist, wann der Filter greift. Wird er erst auf die fertige Trefferliste angewendet, belegen verbotene Dokumente Plätze, die ein erlaubtes Dokument gebraucht hätte, und Ausschnitte können entstehen, bevor der Filter läuft. Greift er schon in der Suche, rechnet das Ranking von Anfang an nur über erlaubte Stücke. Der Trichter oben zeigt es: Der Berechtigungsfilter steht ganz vorn, noch vor dem ersten Ranking.
Dafür müssen die Zugriffslisten der Quelle gemeinsam mit den Inhalten in den Index gelangen und aktuell gehalten werden. In der Einrichtung des Google-Drive-Konnektors in TheroAI ist das sichtbar: Die Indexierung der Benutzerberechtigungen steht als eigener, abgehakter Punkt dort, daneben die Aktualisierung von Inhalten und Berechtigungen mehrmals pro Stunde. Mehr zu den Konnektoren finden Sie auf der Seite zu den Konnektoren.
Auch hier gibt es eine ehrliche Grenze: Der Index ist so aktuell wie die letzte Synchronisation. Wird eine Freigabe in der Quelle entzogen, vergeht bis zur Spiegelung im Index ein Zeitfenster. Wie lang es ist, hängt von der Quelle und vom Sync-Intervall ab. Fragen Sie jeden Anbieter nach diesem Wert, die Antwort „synchronisiert“ allein genügt nicht. Wie TheroAI Berechtigungen im Detail spiegelt, beschreibt unser Artikel zur Berechtigungs-Spiegelung. Zum Thema Datenhaltung und Sicherheit insgesamt finden Sie Näheres unter Sicherheit.
Der Beleg: Antwort mit Quellen
Am Ende der Kette steht die Antwort, und mit ihr die Frage, ob man sie prüfen kann. Eine Suche, die gut gefunden hat, kann das zeigen: Jede Aussage trägt eine Nummer, und die Nummer führt zu der Stelle, aus der sie stammt.
Das fiktive Beispiel aus dem Anlagenbau zeigt, wie das aussieht. Auf die Frage, was bei der Abnahme der Abfüllanlage im Projekt P-2291 vereinbart und was nicht erfüllt wurde, antwortet der Assistent mit einer Tabelle aus Kriterium, Vereinbartem, Gemessenem und Ergebnis. Drei Kriterien sind erfüllt, der Formatwechsel nicht: vereinbart waren höchstens 30 Minuten, gemessen wurden 34. Rechts öffnet sich die Quellenleiste mit dem Abnahmeprotokoll, Dokument AP-2291-02, datiert vom 17.10.2025.
Diese Nummer ist die Rückfahrkarte durch die ganze Kette. Wenn die Antwort falsch ist, kann man zurückverfolgen, welches Stück das Modell bekam, ob es richtig geschnitten war, ob die Kontextzeile stimmte und ob es auf einem sinnvollen Platz stand. Ohne Beleg bleibt nur das Bauchgefühl. Branchenbeispiele dazu finden Sie auf der Seite für den Anlagenbau.
Woran Suchen scheitern: sieben Muster
In der Praxis wiederholen sich dieselben Fehlerbilder. Die folgende Übersicht ordnet sie den Stationen zu und nennt, woran man sie im Alltag erkennt.
| Muster | Station | Woran Sie es merken | Gegenmittel |
|---|---|---|---|
| Stücke zu groß | Aufteilen | Antworten sind allgemein, die konkrete Stelle fehlt | An Struktur schneiden, kleinere, thematische Stücke |
| Stücke zu klein | Aufteilen | Zahlen ohne Bezug, Antwort widerspricht sich | Zusammengehörige Sätze bündeln, leichte Überlappung |
| Fehlender Kontext | Einbetten | Gleich lautende Sätze aus verschiedenen Dokumenten werden verwechselt | Kontextzeile mit Titel, Abschnitt und Datum |
| Kennungen untergehen | Suchen | Die Suche liefert Themen, aber nicht die genaue Nummer | Stichwortsuche zuschalten, Schreibweisen vereinheitlichen |
| Abkürzungen unbekannt | Suchen | Wer das Kürzel nutzt, findet nichts, wer es ausschreibt, schon | Gepflegte Abkürzungs- und Synonymliste |
| Falsche Reihenfolge | Neu ordnen | Das richtige Dokument ist da, steht aber auf Platz 9 | Reranker auf die besten Kandidaten |
| Filter zu spät | Berechtigungen | Antworten ändern sich nach Entzug einer Freigabe nicht, oder Treffer fehlen ohne Grund | Filter in der Suche, kurze Sync-Intervalle |
Zwei Muster verdienen eine zusätzliche Anmerkung. Das erste sind veraltete Fassungen: Liegen von einem Vertrag drei Versionen im Bestand, findet die Suche alle drei und hat keinen Grund, die jüngste zu bevorzugen. Hier hilft das Datum in der Kontextzeile und, wo es um Verbindlichkeit geht, eine klare Ablage der gültigen Fassung. Das zweite sind Tabellen und Scans. Eine Tabelle, die als Bild abgelegt wurde, enthält für eine Textsuche keinen Text, bis eine Erkennung ihn herausholt. Fragen Sie bei einem Anbieter nach, wie Tabellen und eingescannte Dokumente behandelt werden.
So prüfen Sie Ihre eigene Suche
Man kann eine Suche nicht allein an einer Demo beurteilen, weil Demos mit Fragen laufen, die der Anbieter gut kennt. Ein ehrlicher Test dauert einen Nachmittag und braucht keine Software.
- 1.Sammeln Sie 20 echte Fragen aus dem Arbeitsalltag, nicht 20 schöne. Mischen Sie Fragen mit Kennungen, mit Umschreibungen und mit Abkürzungen.
- 2.Notieren Sie zu jeder Frage vorab, in welchem Dokument und an welcher Stelle die Antwort steht.
- 3.Lassen Sie die Fragen stellen und prüfen Sie nicht zuerst die Antwort, sondern die Quellen: Steht die richtige Stelle unter den ersten fünf?
- 4.Zählen Sie getrennt nach Fragetyp. Wenn alle Kennungsfragen scheitern, ist das ein Hinweis auf fehlende Stichwortsuche. Scheitern die Umschreibungen, fehlt die Bedeutungssuche.
- 5.Wiederholen Sie den Test nach jeder größeren Änderung an Ablage oder Einstellungen. Eine Suche wird nicht einmal gut, sondern bleibt gut oder wird schlechter.
Der Test misst nichts Allgemeingültiges. Er sagt Ihnen, wie eine Suche mit Ihren Dokumenten und Ihren Fragen umgeht, und das ist die einzige Zahl, die für Sie zählt. Und er zeigt ein ehrliches Ergebnis, das niemand gerne hört: Keine Suche findet alles. Entscheidend ist, was sie tut, wenn sie nichts findet. Ein guter Assistent sagt das dann, statt eine plausible Antwort zu erfinden.
Was Sie daraus mitnehmen können
Wenn Sie eine Unternehmenssuche bewerten oder aufbauen, lohnen sich diese Prüffragen:
- Wie werden Dokumente aufgeteilt, nach fester Länge oder entlang der Struktur, und bleiben Tabellenköpfe bei den Zeilen?
- Bekommt jedes Stück eine Kontextzeile mit Titel, Abschnitt und Datum, bevor es eingebettet wird?
- Läuft neben der Bedeutungssuche auch eine Stichwortsuche, damit Kennungen und Kürzel gefunden werden?
- Werden die Kandidaten vor dem Modell neu geordnet, und wie viele Stücke bekommt das Modell am Ende?
- Wirkt der Berechtigungsfilter vor dem Ranking, und wie schnell kommt ein Entzug im Index an?
- Zeigt jede Aussage eine Quelle, die Sie öffnen und mit der Stelle im Dokument vergleichen können?
Unsere Position: Eine gute Unternehmenssuche ist keine einzelne kluge Idee, sondern eine Kette gewöhnlicher Entscheidungen, von denen keine allein glänzt und jede einzeln scheitern kann. Wer die Kette kennt, verlässt sich nicht auf die Behauptung „die KI findet alles“, sondern prüft nach, wo sie hält. Das ist weniger spektakulär als ein Wundermodell und deutlich verlässlicher.
Wenn Sie sehen möchten, wie das mit Ihren eigenen Fragen aussieht, zeigen wir Ihnen das gern in einer kurzen Demo, ohne Druck und mit Ihren Beispielen.
Thero live sehen
Buchen Sie eine kurze Demo. Sie sprechen direkt mit dem Gründerteam.