Donnerstag, kurz vor Schichtbeginn. Ein Instandhalter in einem Abfüllbetrieb fragt den Assistenten: „Der Füller FL-200 meldet Fehler E-217. Gab es das schon einmal, und was hat geholfen?“ Die Antwort kommt in Sekunden, sauber formuliert, mit zwei Quellen: dem Wartungshandbuch und einer älteren Störungsmeldung. Sie klingt vollständig. Sie ist es nicht.
Dieses Beispiel ist ausdrücklich erfunden, es stammt aus den fiktiven Demo-Unterlagen unserer Branchenseiten, aber es ist typisch. Was dem Assistenten fehlt, ist das Service-Protokoll vom letzten Einsatz. Es liegt als Foto-PDF unter dem Namen „Scan_0048.pdf“ in einem Ordner, enthält handschriftliche Notizen des Servicetechnikers, einen Firmenstempel und keinen einzigen Buchstaben, den ein Programm lesen könnte. Genau dort stand, dass bei E-217 ein Sensor getauscht wurde und nicht die Dichtung. Der Assistent hat nicht gelogen. Er hat mit dem geantwortet, was er lesen konnte. Das ist das eigentliche Problem.
Unsere These in einem Satz: Bevor Sie ein Wissenssystem anbinden, prüfen Sie, was darin lesbar ist, und verlangen Sie von jedem System, dass es Unlesbares meldet, statt still darüber hinwegzugehen. Dieser Artikel zeigt, wo Dokumente für eine KI unlesbar werden, wie Sie das mit einer kleinen Stichprobe messen, welche Aufräumarbeit sich lohnt und was ein Assistent von sich aus sichtbar machen sollte. Wie so ein Alltag in der Produktion aussieht, beschreiben wir auf der Seite KI für die Fertigung.
Das stille Loch: Warum Lücken gefährlicher sind als Fehler
Ein System, das laut scheitert, ist leicht zu beherrschen. Es zeigt eine Fehlermeldung, jemand kümmert sich darum, nach einer Stunde läuft es wieder. Ein Wissensassistent scheitert anders. Er antwortet aus dem, was da ist, und was nicht da ist, hinterlässt keine Spur. Drei Eigenschaften machen das tückisch:
- Ein nicht lesbares Dokument erzeugt keine Fehlermeldung in der Antwort. Es fehlt einfach.
- Die Antwort bleibt flüssig und selbstsicher, weil Sprachmodelle aus wenig Material trotzdem einen runden Text bauen.
- Wer die Quellen unter der Antwort prüft, prüft die Quellen, die da sind. Die fehlende Quelle taucht in keiner Liste auf.
Wir nennen das die Vollständigkeitsillusion. Sie entsteht nicht aus Böswilligkeit der Technik, sondern aus der Natur der Sache: Eine Antwort kann nur über das berichten, was durchsuchbar ist. Über das Nichtdurchsuchbare kann sie nichts sagen, nicht einmal, dass es existiert.
Gedankenexperiment: Ihre Ablage hat 1.000 Dokumente, und 140 davon sind für die KI unsichtbar. Woran würden Sie bei der nächsten Antwort merken, dass es 140 sind und nicht null?
Die ehrliche Antwort lautet: gar nicht. Genau deshalb gehört die Prüfung der Datenqualität vor die Anbindung und nicht danach, wenn die ersten Antworten schon im Umlauf sind. Die Zahl 140 ist hier kein Messwert, sondern das Rechenbeispiel, das wir weiter unten im Artikel aufbauen.
Der Weg eines Dokuments: Vier Stationen können etwas verlieren
Damit klar wird, wo ein Dokument unlesbar wird, hilft ein Blick auf den Weg, den es nimmt. Er ist bei den meisten Wissenssystemen ähnlich, auch wenn die Begriffe wechseln: Das Dokument liegt in einer Ablage, wird gelesen, in Abschnitte zerlegt, bei einer Frage nach passenden Stellen durchsucht, und aus diesen Stellen entsteht die Antwort.
An jeder der ersten vier Stationen geht eine andere Art von Information verloren:
- Ablage: Ein Name wie „final_v2_neu“ sagt weder, was im Dokument steht, noch, ob es gilt. Mehrere Fassungen liegen ohne Kennzeichnung nebeneinander.
- Lesen: Ein Scan ohne Textebene hat nichts, was sich herauslösen ließe. Stempel und Handschrift bleiben leer oder werden falsch erkannt.
- Zerlegen: Eine Tabellenzeile verliert ihre Spaltenköpfe, mehrspaltiger Text wird quer gelesen, und es entstehen Sätze, die so nie geschrieben wurden.
- Finden: Die alte Fassung ist genauso gut auffindbar wie die neue, weil beide denselben Wortlaut enthalten.
Die fünfte Station, die Antwort, ist die einzige, die Sie sehen. Sie macht aus den Lücken der anderen vier einen geschlossenen, gut lesbaren Text. Die Lücken entstehen also, bevor die KI etwas sieht, und das ist die gute Nachricht: Ein großer Teil davon lässt sich mit Aufräumen auf der Seite der Dokumente beheben, ohne dass ein Modell getauscht werden muss.
Sechs Arten von Dokumenten, die eine KI schlecht oder gar nicht liest
In der Praxis laufen die Probleme auf sechs Muster hinaus. Die folgende Tabelle fasst sie zusammen, die Abschnitte danach erklären jedes einzelne.
| Art | Was passiert | Woran Sie es erkennen | Gegenmittel |
|---|---|---|---|
| Scan ohne Textebene | Das Dokument ist nur ein Bild, es gibt keinen Text zum Lesen | Im PDF lässt sich kein Satz markieren | Texterkennung oder Neuexport aus der Quelle |
| Tabelle | Zeilen verlieren ihre Spaltenköpfe, verbundene Zellen verrutschen | Zahlen werden ohne Einheit oder Bezug zitiert | Klare Kopfzeile, eine Tabelle pro Blatt, Tabellendatei statt PDF |
| Mehrspaltiges Layout | Der Text wird quer über die Spalten gelesen | Zitate brechen mitten im Satz ab | Einspaltige Fassung, sauberer Export |
| Stempel und Handschrift | Randnotizen und Stempel fehlen oder werden falsch gelesen | Gerade die entscheidende Anmerkung fehlt | Wichtiges als Text erfassen |
| Dateinamen und Ablage | Der Name verrät weder Inhalt noch Stand | Namen wie „final_v2_neu“ oder „Scan_0048“ | Namensregel: Art, Thema, Kennung, Datum |
| Veraltete Versionen | Alte und neue Fassung stehen gleichrangig nebeneinander | Zwei Antworten, die sich widersprechen | Eine gültige Fassung, alte archivieren |
Wie sicher eine Art gelesen wird, ist eine Frage der Abstufung und nicht von Ja oder Nein. Die folgende Übersicht ordnet typische Dokumentarten ein. Sie ist eine Faustregel aus der Praxis und keine Messung.
Scans ohne Textebene: Das Bild eines Textes ist kein Text
Ein Scanner liefert zunächst ein Bild. Erst eine Texterkennung legt eine unsichtbare Textebene über dieses Bild. Fehlt sie, sieht ein Programm nur Pixel. Für Sie sieht die Seite lesbar aus, für ein System ist sie leer. Der einfachste Test dauert zehn Sekunden: Versuchen Sie, im PDF einen Satz zu markieren und zu kopieren. Gelingt das nicht, gibt es keine Textebene.
Auch eine nachträgliche Texterkennung ist nicht fehlerfrei. Sie hängt von der Auflösung des Scans ab, von Schräglage, Flecken und Schriftart. Ein Foto vom Handy, auf dem die Seite schief im Licht liegt, ist ein schwierigerer Fall als ein sauberer Scan mit 300 Punkten pro Zoll. Modelle, die Bilder verstehen, können oft mehr lesen als klassische Texterkennung. Sie brauchen dafür aber mehr Zeit und Rechenaufwand, und sie lesen nicht fehlerfrei. Verlassen Sie sich bei wichtigen Dokumenten deshalb lieber auf eine saubere Quelle: Wenn es das Dokument auch digital gibt, exportieren Sie es noch einmal als PDF aus dem Ursprungsprogramm, statt den Ausdruck zu scannen.
Tabellen: Zahlen ohne Bezug sind schlimmer als keine Zahlen
Eine Tabelle ist nur dann Wissen, wenn jede Zelle weiß, wozu sie gehört. In einem fiktiven Abnahmeprotokoll aus unseren Demo-Unterlagen steht in der Zeile „Formatwechsel“ unter „Vereinbart“ der Wert „höchstens 30 Minuten“ und unter „Gemessen“ der Wert „34 Minuten“. Verliert die Zeile ihre Kopfzeile, bleibt eine 34 übrig. Ob das Minuten, Flaschen oder Prozent sind, weiß dann niemand mehr, auch die KI nicht, und sie rät.
Typische Stolpersteine sind verbundene Zellen, Zwischensummen mitten in der Tabelle, mehrere Tabellen auf einem Excel-Blatt, ausgeblendete Spalten und Kopfzeilen, die über zwei Zeilen laufen. Dazu kommt ein Klassiker im deutschsprachigen Raum: Die Zeichenfolge 1.249 bedeutet bei uns eintausendzweihundertneunundvierzig, in anderen Ländern eins Komma zwei vier neun. Wo Zahlen im deutschen Format in Systemen mit anderer Konvention landen, entstehen leise Fehler. Prüfen Sie bei Tabellen deshalb immer eine Zahl gegen das Original. Und legen Sie Tabellen, wenn möglich, als Tabellendatei ab statt als PDF-Ausdruck einer Tabelle.
Mehrspaltige Layouts: Wer quer liest, bildet Sätze, die es nicht gibt
Datenblätter, Normen, Broschüren und Produktkataloge sind oft in zwei oder drei Spalten gesetzt. Ein Mensch folgt der Spalte nach unten. Ein Programm, das eine Seite zeilenweise liest, springt von der linken in die rechte Spalte und zurück, und es entsteht ein Satz, der halb aus der einen und halb aus der anderen Spalte besteht. Dazu kommen Kopf- und Fußzeilen: „Seite 3 von 12, vertraulich“ steht dann zwischen zwei Absätzen und wird wie Fließtext behandelt.
Der Test ist einfach: Kopieren Sie zwei Absätze aus dem PDF in einen Texteditor und lesen Sie sie laut. Klingt das, was dort steht, nach dem Dokument, ist die Seite gut lesbar. Springt der Sinn, ist das Layout ein Problem. Moderne Leseverfahren erkennen Spalten, aber nicht jedes Layout gelingt, und je ungewöhnlicher der Aufbau, desto eher bleibt es bei einer Stichprobe, die Sie selbst machen müssen.
Stempel und Handschrift: Die wichtigste Notiz steht am Rand
Der Eingangsstempel mit Datum, der Stempel „freigegeben“, die handschriftliche Randnotiz „Dichtung nicht tauschen, Sensor“: Gerade die Informationen, die ein Dokument von einem Entwurf unterscheiden, stehen häufig außerhalb des gedruckten Textes. Sie sind für jedes Leseverfahren die schwierigste Klasse. Handschrift ist selbst für Menschen mitunter schwer zu entziffern, Stempel überlagern den Text darunter, und Unterschriften sind ohnehin keine Sprache.
Rechnen Sie deshalb nicht damit, dass solche Einträge zuverlässig gelesen werden, und lassen Sie keine Entscheidung allein daran hängen. Wenn ein Stempel oder eine Notiz Bedeutung trägt, erfassen Sie sie zusätzlich als Text: in einem Feld des Fachsystems, im Dateinamen oder in einer kurzen Begleitnotiz. Ein Hinweis zum Datenschutz: Handschriftliche Notizen und Unterschriften können personenbezogene Daten enthalten. Ob und wie Sie solche Unterlagen verarbeiten dürfen, hängt vom Einzelfall ab. Das ist keine Rechtsberatung, klären Sie es mit Ihrer Rechtsberatung oder Ihrer Datenschutzbeauftragten.
Dateinamen und Ablage: Der Name ist die erste Information
Dateinamen werden unterschätzt, weil Menschen den Zusammenhang im Kopf haben. Wer lange im Unternehmen ist, weiß, dass „Scan_0048“ der Servicebericht zum Füller ist. Für jeden anderen, und für jedes System, ist der Name die erste und manchmal einzige Auskunft über ein Dokument, bevor der Inhalt überhaupt gelesen wird. Ein Name, der Art, Thema, Kennung und Datum nennt, hilft beim Suchen, beim Prüfen der Quelle und beim Erkennen der gültigen Fassung. Die Beispiele sind erfunden, das Prinzip nicht:
| Vorher | Nachher | Was sich ändert |
|---|---|---|
| Scan_0048.pdf | Servicebericht_FL-200_E-217_2025-03.pdf | Art, Gerät, Fehler und Monat stehen im Namen |
| final_v2_neu.docx | Wartungsplan_FL-200_gueltig-ab-2025-01.docx | Der Stand ist erkennbar |
| Tabelle1.xlsx | Ersatzteile_FL-200_Preise_2025.xlsx | Inhalt und Jahr sind klar |
| Vertrag_alt_NICHT_NUTZEN.pdf | Archiv/Rahmenvertrag_TP-118_2022.pdf | Der Ordner sagt „ersetzt“, nicht der Dateiname |
Eine Namensregel ist die billigste Maßnahme in diesem Artikel, und sie wirkt auch ohne jede KI: Die Kollegen finden schneller, was sie suchen.
Veraltete Versionen: Die alte Fassung ist genauso gut auffindbar wie die neue
Das Problem veralteter Fassungen ist für Menschen unsichtbar, weil sie Zusammenhänge kennen. Für ein Suchsystem stehen zwei Dokumente da, beide passen zur Frage, beide enthalten ähnliche Sätze. Ohne Datum, Version oder Hinweis auf eine Ablösung gibt es keinen Grund, die eine der anderen vorzuziehen. Die Antwort mischt dann Stände oder nimmt den falschen. Besonders heikel sind Preise, Fristen und Verfahrensanweisungen, bei denen sich über die Jahre wenig im Wortlaut ändert, aber viel in der Zahl.
Das Gegenmittel ist doppelt: Legen Sie ersetzte Fassungen in einen Archivbereich, den Sie nicht anbinden, und lassen Sie sich bei jeder Antwort zeigen, auf welchem Dokument und welchem Stand sie beruht.
Datenqualität messen, bevor Sie etwas anbinden: Die Stichprobe
Die meisten Unternehmen kennen ihre Ablage gefühlt, aber nicht in Zahlen. Das ist normal, denn niemand hat je gebraucht, was eine KI jetzt braucht: den Überblick, wie viele Dokumente maschinenlesbar sind. Die gute Nachricht ist, dass Sie keine Vollprüfung brauchen. Eine kleine Zufallsstichprobe liefert die Größenordnung. Das folgende Rechenbeispiel ist ausdrücklich illustrativ. Es zeigt die Methode, nicht Ihre Zahlen.
Die Methode in drei Schritten
- 1.Ziehen Sie zufällig 50 Dokumente aus der Ablage, die Sie anbinden wollen. Zufällig heißt: nicht die schönsten, nicht die wichtigsten, sondern etwa jedes zwanzigste.
- 2.Prüfen Sie jedes Dokument mit den vier Fragen der Aufräum-Checkliste weiter unten und notieren Sie genau einen Befund: ohne Befund, Scan ohne Textebene, Tabelle mit Problem, Spalten vermischt oder veraltete Fassung.
- 3.Rechnen Sie hoch: Hat die Ablage 1.000 Dokumente und prüfen Sie 50, multiplizieren Sie mit 20.
| Annahme in der Beispielrechnung | Wert |
|---|---|
| Umfang der Ablage | 1.000 Dokumente (Annahme) |
| Stichprobe | 50 zufällig gezogene Dokumente, das sind 5 Prozent |
| Hochrechnungsfaktor | 20 |
Angenommen, die Stichprobe ergibt das folgende Bild:
| Befund | In der Stichprobe | Hochgerechnet auf 1.000 | Anteil |
|---|---|---|---|
| Ohne Befund | 34 | 680 | 68 % |
| Scan ohne Textebene | 7 | 140 | 14 % |
| Tabelle mit Problem | 4 | 80 | 8 % |
| Spalten vermischt | 3 | 60 | 6 % |
| Veraltete Fassung | 2 | 40 | 4 % |
| Summe | 50 | 1.000 | 100 % |
Das Beispiel enthält zwei Botschaften. Erstens: 320 von 1.000 Dokumenten, also 32 Prozent, brauchen Aufmerksamkeit, knapp ein Drittel. Zweitens: Der größte Einzelposten sind die 140 Scans ohne Textebene, und genau die sind für die Anwender nicht sichtbar. Eine Stichprobe von 50 Dokumenten nennt Ihnen die Größenordnung, nicht die zweite Nachkommastelle. Wenn Sie in der Praxis 14 Prozent oder 10 oder 20 Prozent Scans finden, ändert das die Reihenfolge der Arbeit nur selten. Es zeigt, ob Sie ein Randproblem oder ein Hauptproblem haben.
Die zweite Probe: Fragen mit bekannter Antwort
Die Stichprobe prüft Dokumente. Die zweite Probe prüft das Ergebnis. Sammeln Sie zehn bis zwanzig Fragen, deren richtige Antwort Sie kennen und die in Ihrem Alltag wirklich vorkommen, zum Beispiel: „Welche Kündigungsfrist gilt im Rahmenvertrag mit TP-118?“ oder „Was war die Ursache bei E-217?“. Stellen Sie sie dem Assistenten und vergleichen Sie. Jede falsche oder unvollständige Antwort hat eine Ursache in den Dokumenten, und meist ist es eine der sechs Arten aus diesem Artikel. Diese Testfragen sind außerdem Ihre Regressionsprobe: Nach jedem Aufräumen und nach jeder neuen Anbindung stellen Sie dieselben Fragen noch einmal.
Die Probe mit Fragen ist ehrlicher als jede Statistik, weil sie genau das misst, was zählt: ob die Menschen, die fragen, richtige Antworten bekommen.
Die kleine Aufräum-Checkliste: Vier Fragen pro Dokument
Aufräumen ist kein Großprojekt, solange Sie sich auf das beschränken, wonach Ihre Leute tatsächlich fragen. Beginnen Sie mit den zwanzig Themen, die im Alltag am häufigsten auftauchen, und gehen Sie die zugehörigen Dokumente mit diesen vier Fragen durch:
- 1.Lässt sich ein Satz markieren? Wenn nein: Texterkennung laufen lassen oder das Dokument aus der Quelle neu exportieren.
- 2.Ist es die gültige Fassung? Wenn nein: die alte Fassung archivieren und den Stand im Namen führen.
- 3.Sagt der Dateiname, was drinsteht? Wenn nein: umbenennen nach der Regel Art, Thema, Kennung, Datum.
- 4.Bleibt die Tabelle eine Tabelle? Wenn nein: als Tabellendatei ablegen oder eine Kopfzeile ergänzen.
Für die Ablage als Ganzes helfen fünf Gewohnheiten, die nichts kosten, aber viel verhindern:
- Jeder Ordner hat eine verantwortliche Person, die sagt, was dort gilt.
- Neue Scans landen in einem Eingangsordner und werden erst nach der Texterkennung in die Ablage verschoben.
- Ersetzte Fassungen wandern in einen Archivbereich, der nicht angebunden wird.
- Es gibt eine einzige Namensregel, die kurz genug ist, dass sie jeder behält.
- Die Stichprobe wird nach dem ersten Lauf wiederholt, um zu sehen, ob sich die Befunde verändert haben.
Diese Liste ist absichtlich kurz. Wer versucht, zuerst alles zu bereinigen, wird nie anfangen. Wer mit den häufigsten Fragen beginnt, hat nach wenigen Wochen die Dokumente in Ordnung, die jeden Tag gebraucht werden.
Was ein Assistent melden sollte, statt still zu scheitern
Bisher ging es um Ihre Dokumente. Die zweite Hälfte der These betrifft das System: Ein Wissenssystem sollte Unlesbares sichtbar machen. Wenn ein Dokument nicht oder nur teilweise gelesen werden kann, braucht es einen Zustand, den Menschen sehen können, und keine stille Lücke. Das ist keine Kür, sondern die Voraussetzung dafür, dass Aufräumen überhaupt gelingt: Wer nicht sieht, welche Dokumente ausfallen, kann sie nicht beheben.
In TheroAI hat jedes angebundene Dokument einen Indexierungsstatus. Er steht in den Details des Dokuments, und in den Statistiken je App werden fehlgeschlagene, nicht gestartete und nicht unterstützte Dokumente getrennt gezählt. Die wichtigsten Meldungen der deutschen Oberfläche und was Sie damit tun:
Ein paar Hinweise dazu:
- Teilweise indexiert bedeutet laut Hinweistext, dass das Dokument die Obergrenze überschreitet und nur der erste Teil durchsuchbar ist. Das ist eine ehrliche Auskunft über einen Verlust, den man sonst nie bemerkt hätte, und die Lösung ist meist, ein langes Dokument in sinnvolle Teile zu trennen.
- Kein Inhalt heißt nach unserem Verständnis, dass beim Lesen kein Text herauskam. Ein Scan ohne Textebene ist hier ein typischer Kandidat, je nach Einrichtung landet er stattdessen bei „Multimodales Modell nötig“. Auch eine leere Datei gehört dazu.
- Nicht unterstützt meldet, dass der Dateityp nicht verarbeitet wird. Das ist unbequem und trotzdem besser als Schweigen, denn Sie wissen, dass dort ein Loch ist.
- Multimodales Modell nötig erscheint nach unserem Verständnis, wenn ein Dokument nur mit einem Modell zu lesen ist, das Bilder versteht, und keines eingerichtet ist. Für Scans und Fotos ist das die Weiche zwischen leer und lesbar.
- Daneben weist das Produkt darauf hin, wenn einzelne Seiten nur aus der Textebene gelesen wurden und Tabellen oder Abbildungen dieser Seiten als einfacher Text vorliegen.
Auf Ebene der Anbindung sehen Sie die Bilanz auf einen Blick. In der Demo-Umgebung unserer Aufnahme zeigt die Liste der Apps bei Google Drive 396 Dokumente, davon 297 indiziert, bei Gmail 6.743 Dokumente, davon 5.915 indiziert.
Die Differenz, 99 Dokumente bei Drive und 828 bei Gmail, ist noch kein Befund. Manche Dokumente warten in der Warteschlange, andere sind gerade in Arbeit. Aber sie ist die Liste, die Sie abarbeiten: Sehen Sie sich an, welche Status sich dahinter verbergen, und Sie wissen, ob es ein Vorlaufproblem ist oder ein Qualitätsproblem. Wie die Anbindung von Apps und Konnektoren im Einzelnen abläuft, haben wir an anderer Stelle beschrieben.
Was ein Status nicht leistet
Ehrlichkeit gehört zur Beschreibung. Ein Status sagt, ob ein Dokument gelesen wurde, nicht, wie gut. Ein Dokument mit dem Status „Indexiert“ kann trotzdem Spalten vermischt, eine Tabelle ohne Bezug oder eine alte Fassung enthalten. Der Status schließt die gröbste Lücke, die stille. Er ersetzt weder die Stichprobe noch die Fragen mit bekannter Antwort. Und er ändert nichts daran, dass der Assistent unter jeder Antwort nummerierte Quellen zeigt, die Sie in Stichproben öffnen sollten: Wer die Quelle nie liest, verlässt sich auf das System, das er prüfen wollte.
Was Aufräumen nicht leisten kann
Sauber heißt nicht richtig. Ein perfekt lesbares Dokument kann inhaltlich falsch sein, und ein sauber benannter Vertrag kann seit einem Jahr überholt sein, ohne dass es im Namen steht. Aufräumen sorgt dafür, dass die KI sieht, was Sie ihr zeigen wollen. Ob es stimmt, entscheidet weiter Ihr Fachwissen, deshalb gehört eine verantwortliche Person je Ordner zu den fünf Gewohnheiten.
Außerdem hat die Arbeit Grenzen im Aufwand. Handschriftliche Altbestände, Mikrofilme und Ausdrucke aus den Neunzigern können Sie nicht komplett aufbereiten, und das müssen Sie auch nicht. Entscheiden Sie bewusst, was angebunden wird, und halten Sie fest, was nicht: Eine kurze Liste „bewusst nicht angebunden“ ist selbst ein Stück Datenqualität, weil sie verhindert, dass jemand annimmt, die KI wisse davon.
Und schließlich ist da der Datenschutz: Dokumente mit personenbezogenen Daten, etwa Personalakten, Bewerbungen oder gescannte Unterschriftenlisten, sind nicht allein deshalb für eine Anbindung geeignet, weil sie lesbar sind. Ob und unter welchen Bedingungen sie verarbeitet werden dürfen, ist eine Frage des Einzelfalls. Das ist keine Rechtsberatung, klären Sie es mit Ihrer Rechtsberatung und Ihrer Datenschutzbeauftragten, bevor Sie anbinden.
Was Sie daraus mitnehmen können
Eine KI ist so gut informiert wie die Dokumente, die sie lesen kann. Wer anbindet, ohne zu prüfen, bekommt ein System, das mit voller Überzeugung auf einem Teil des Wissens antwortet, und in unserer Beispielrechnung wären das 68 Prozent der Ablage, die ohne Befund sind. Der Rest ist die stille Lücke, die diesem Artikel den Namen gibt. Unsere Position: Prüfen Sie zuerst, räumen Sie das auf, was oft gebraucht wird, und verlangen Sie von jedem System, dass es Unlesbares meldet.
Sechs Prüffragen für die nächste Woche:
- Haben wir 50 zufällige Dokumente aus der Ablage geprüft und die Befunde gezählt?
- Wie viele Scans ohne Textebene stecken darin, und stehen sie in Themen, nach denen oft gefragt wird?
- Haben wir zehn bis zwanzig Fragen mit bekannter Antwort gesammelt, mit denen wir jede Änderung testen?
- Gibt es eine Namensregel und einen Archivbereich für ersetzte Fassungen?
- Meldet das System unlesbare, teilweise gelesene und nicht unterstützte Dokumente sichtbar, und wer schaut regelmäßig auf diese Meldungen?
- Wer ist je Ordner dafür verantwortlich, dass dort steht, was gilt?
Und drei Schritte für die Woche danach: Ziehen Sie die Stichprobe und rechnen Sie hoch. Räumen Sie die Dokumente zu den zwanzig häufigsten Themen auf. Binden Sie erst dann an, und wiederholen Sie die Stichprobe nach dem ersten Lauf.
Wenn Sie sehen möchten, wie so eine Anbindung mit Statusmeldungen und Quellen in einer Demo-Umgebung aussieht, schauen wir uns das gern gemeinsam an. Eine kurze Demo genügt, und Sie entscheiden danach in Ruhe, was für Ihre Ablage der nächste sinnvolle Schritt ist.
Thero live sehen
Buchen Sie eine kurze Demo. Sie sprechen direkt mit dem Gründerteam.