Stellen Sie sich ein Quartalsgespräch vor. Ein Unternehmen hat im Frühjahr einen KI-Assistenten eingeführt, dazu drei Abläufe: Kundenantworten vorbereiten, Besprechungen zusammenfassen und einen Wochenbericht erstellen. Die Finanzleitung stellt eine einfache Frage: „Was hat uns das gebracht?“ Die Projektleiterin antwortet ehrlich: „Die Leute finden es gut, und ich glaube, wir sparen viel Zeit.“
Das Szenario ist ein Gedankenexperiment, kein Kundenfall. Die Antwort ist trotzdem typisch, und sie ist nicht falsch. Sie ist nur eine Behauptung. Wer eine Behauptung hört, muss glauben oder widersprechen. Wer einen Nachweis sieht, kann prüfen, nachrechnen und nachfragen. Zwischen beidem liegt kein riesiger Aufwand, aber eine Reihe von Entscheidungen, die man vor dem Start treffen muss und nicht erst im Quartalsgespräch.
Dieser Artikel beschreibt fünf Kennzahlen für eine Unternehmens-KI: Nutzung, Erfolgsquote von Abläufen, geschätzte Zeitersparnis, Qualität und Zeit bis zur Antwort. Er zeigt, wo Sie sie in den Auswertungen von TheroAI finden, wofür sie taugen und, mindestens so wichtig, wofür nicht. Dazu gehört eine Beispielrechnung, die klar als Beispiel gekennzeichnet ist.
Unsere These: Nutzen lässt sich nachweisen, wenn man drei Dinge sauber trennt, nämlich was gemessen wird, was geschätzt wird und was Menschen beurteilen. Und wenn man den Vorher-Wert erfasst, bevor die KI im Alltag ankommt. Wer das tut, kann auch eine bescheidene Zahl selbstbewusst vertreten. Wer es nicht tut, vertritt auch eine große Zahl nur mit Glauben.
Warum „Die Leute finden es gut“ nicht reicht
Zustimmung ist wertvoll. Ohne sie wird kein Werkzeug benutzt, und ein ungenutztes Werkzeug bringt nichts. Aber Zustimmung beantwortet eine andere Frage als die der Finanzleitung. Sie sagt, dass etwas gefällt. Sie sagt nicht, dass etwas wirkt. Drei Gründe, warum das in der Praxis auseinanderfällt:
Neuheit ist kein Dauerzustand. In den ersten Wochen probieren viele Menschen aus, was möglich ist. Die Nutzungszahlen sind hoch, die Stimmung ist gut. Ob daraus eine Gewohnheit wird, zeigt sich erst nach Monaten, und nur eine Zahl über die Zeit kann das zeigen.
Gefühlte Zeitersparnis ist unzuverlässig. Wer einen Entwurf in Sekunden bekommt, erinnert sich an die Sekunden. Die Minuten, die er danach mit Prüfen und Anpassen verbringt, verblassen schneller. Das ist keine Unehrlichkeit, sondern Wahrnehmung. Deshalb braucht es einen Vergleich mit etwas, das vor dem Start festgehalten wurde.
Ohne Vorher-Wert gibt es kein Nachher. Wenn niemand weiß, wie lange eine Kundenantwort vorher gedauert hat, kann niemand sagen, ob sie jetzt kürzer dauert. Genau diese Lücke lässt sich im Nachhinein nicht schließen. Man kann Menschen fragen, wie es früher war, aber das ist wieder Erinnerung.
Dazu kommt ein pragmatischer Grund. Ein Budget, das verlängert werden soll, braucht eine Begründung, die auch jemand verstehen kann, der den Assistenten nie geöffnet hat. Eine Zahl mit Herkunft ist so eine Begründung. Eine Stimmung ist es nicht.
Fünf Kennzahlen, die zusammengehören
Es gibt unzählige Kennzahlen, die man erheben könnte. Wir halten fünf für ausreichend, solange man sie zusammen liest. Jede beantwortet genau eine Frage, und die Fragen bauen aufeinander auf: Wird die KI benutzt? Läuft sie durch? Hilft das Ergebnis? Wird dadurch Zeit frei? Und kommt die Antwort beim Gegenüber schneller an?
Die Grafik zeigt auch, was die meisten Berichte verschweigen: Nicht alle Zahlen haben dieselbe Art von Wahrheit. Manches wird gezählt, manches wird gerechnet, manches ist das Urteil eines Menschen. Die folgende Tabelle ordnet die fünf Kennzahlen ein und nennt die häufigste Falle.
| Kennzahl | Frage dahinter | Wo Sie sie finden | Art der Zahl | Häufigste Falle |
|---|---|---|---|---|
| Nutzung | Wird die KI im Alltag gebraucht? | Dashboard: Ausführungen, Prozesse gesamt, Zeitraum 7, 30 oder 90 Tage | gemessen | Anfängliche Neugier wird mit Gewohnheit verwechselt |
| Erfolgsquote | Läuft der Ablauf durch? | Dashboard: Erfolgsquote, Audit-Log: Status | gemessen | Durchgelaufen heißt nicht richtig |
| Qualität | Hilft das Ergebnis? | Feedback: Hilfreich-Quote, Bewertung | Urteil von Menschen | Wenige Rückmeldungen, verzerrte Auswahl |
| Zeitersparnis | Wird Arbeitszeit frei? | Dashboard: Geschätzte Zeitersparnis | geschätzt | Eine Annahme sieht aus wie eine Messung |
| Zeit bis zur Antwort | Geht es schneller? | Audit-Log: Dauer, Ø Dauer | gemessen (Laufzeit) | Laufzeit ist nicht Wartezeit |
In TheroAI liegen diese Zahlen an einer Stelle: in den Auswertungen, mit den vier Reitern Dashboard, Audit-Log, Feedback und Muster. Die Reihenfolge der folgenden Abschnitte entspricht der Reihenfolge der Fragen.
Nutzung: wer fragt, wie oft, und wofür nicht
Die Nutzung ist die einfachste Kennzahl und die am häufigsten falsch gelesene. Das Dashboard zeigt die Zahl der Ausführungen, die Zahl der Prozesse gesamt und eine Übersicht nach Abteilungen. Als Zeitraum lassen sich 7, 30 oder 90 Tage wählen. Für den Bericht gibt es einen PDF-Export.
Was Sie daraus lesen sollten, ist selten die Gesamtzahl. Aussagekräftiger sind drei Fragen:
- Wie verläuft die Kurve? Steigt die Zahl der Ausführungen über 30 und 90 Tage, bleibt sie flach oder fällt sie nach einem Anfangshoch wieder ab?
- Wie breit ist die Nutzung? Laufen alle eingerichteten Abläufe oder nur einer? Ein einzelner Ablauf, der 90 Prozent aller Läufe erzeugt, ist ein Befund, kein Erfolg.
- Wo sitzt sie? Die Abteilungs-Übersicht zeigt, in welchen Gruppen die Abläufe tatsächlich laufen und welcher Ablauf dort am häufigsten ausgeführt wird.
Eine Einschränkung gehört dazu. Die Auswertung zählt Läufe von Agenten und Abläufen. Wie oft Menschen mit dem Assistenten im Chat arbeiten, ist eine andere Art der Nutzung. Wenn Sie sie bewerten wollen, brauchen Sie dafür eine eigene Messung, zum Beispiel eine kurze Befragung nach dem Pilot oder eine Stichprobe von Gesprächen im Team. Eine Zahl, die man nicht hat, sollte man nicht aus einer anderen ableiten.
Und noch eine Warnung vor dem Umkehrschluss: Viele Läufe sind nicht automatisch viel Nutzen. Ein Ablauf kann hundertmal am Tag laufen und jedes Mal ein Ergebnis liefern, das niemand liest. Die Nutzung ist die Eintrittskarte für die anderen Kennzahlen, nicht ihr Ersatz.
Erfolgsquote: durchgelaufen ist nicht richtig
Die zweite Frage lautet, ob ein Ablauf durchläuft. Das Dashboard weist dafür die Erfolgsquote aus, im Audit-Log hat jeder Lauf einen Status: Erfolgreich, Fehlgeschlagen oder Ausstehend. Über „Statistik anzeigen“ blenden Administratoren oberhalb der Tabelle vier Kennzahlen ein: Gesamt, Erfolgreich, Fehlgeschlagen und die durchschnittliche Dauer.
Die Erfolgsquote ist eine technische Zahl. Sie sagt, dass ein Lauf bis zum Ende durchgekommen ist. Sie sagt nicht, dass das Ergebnis stimmte. Ein Ablauf, der zuverlässig eine Zusammenfassung mit dem falschen Schwerpunkt liefert, hat eine Erfolgsquote von 100 Prozent und einen Nutzen von null. Umgekehrt ist eine niedrige Quote nicht immer ein Qualitätsproblem: Fällt eine Anbindung aus oder fehlt eine Berechtigung, scheitert der Lauf, obwohl der Ablauf selbst gut ist.
Deshalb lohnt es sich, die Erfolgsquote nie allein zu zeigen. Zwei Dinge gehören dazu: ein Blick auf die fehlgeschlagenen Läufe, bevor man sie als Rauschen abtut, und die Qualitätszahl aus den Rückmeldungen. Wie beides zusammenspielt, zeigen wir weiter unten in einer kleinen Matrix.
Geschätzte Zeitersparnis: warum „geschätzt“ das ehrliche Wort ist
Die Zeitersparnis ist die Zahl, die jeder sehen will, und die, bei der am meisten geschummelt wird, oft unabsichtlich. In den Auswertungen heißt sie bewusst „Geschätzte Zeitersparnis“, und dieses Adjektiv ist keine Vorsicht aus Gewohnheit, sondern die richtige Beschreibung.
Zur Rechnung: Ist für einen Ablauf eine Vergleichszeit hinterlegt, also die Minuten, die die Arbeit je Fall von Hand dauert, rechnet die Auswertung die Zahl der Läufe mal diese Vergleichszeit. Wie und von wem diese Zeit für Ihre Abläufe hinterlegt wird, klären Sie am besten bei der Einrichtung. Ohne hinterlegte Vergleichszeit nimmt sie eine pauschale Annahme: das Dreifache der durchschnittlichen Laufzeit, mindestens fünf Minuten je Lauf. Diese Pauschale ist ein Platzhalter. Sie ist besser als eine leere Spalte, aber sie ist keine Messung. Für die Zahlen ohne Vergleichszeit gilt also: Größenordnung, kein Beleg.
Warum „geschätzt“ auch mit einer sorgfältig erfassten Vergleichszeit das richtige Wort bleibt, hat drei Gründe:
- 1.Der Vergleichsfall existiert nicht. Niemand kann beobachten, wie lange dieselbe Aufgabe von Hand gedauert hätte, während sie die KI erledigt hat. Man kann nur eine Vergleichszeit aus früheren Fällen übertragen.
- 2.Die Prüfzeit fehlt in der einfachen Rechnung. Läufe mal Vergleichszeit unterstellt, dass die KI die ganze Arbeit abnimmt. In Wahrheit liest, korrigiert und gibt ein Mensch das Ergebnis frei. Diese Zeit gehört abgezogen.
- 3.Freie Zeit ist nicht gleich genutzte Zeit. Wenn zehn Minuten frei werden, ist offen, ob daraus zehn Minuten produktive Arbeit werden. Es bleibt Kapazität, kein Geld auf dem Konto.
Eine saubere Berichtspraxis trennt deshalb drei Dinge, die in Präsentationen oft ineinander rutschen: die beobachtete Zeit (gemessen vorher und nachher), den Kapazitätswert (freie Stunden, rechnerisch) und die finanzielle Einsparung (nur, wenn Kosten tatsächlich sinken). Wer die dritte Zahl aus der ersten ableitet, ohne die zweite zu erwähnen, behauptet mehr, als er belegen kann.
Wenn Sie die Rechnung mit eigenen Annahmen durchspielen wollen, hilft der ROI-Rechner. Er ersetzt keine Messung, aber er zwingt dazu, die Annahmen aufzuschreiben.
Die Baseline: den Vorher-Wert erfassen, bevor es losgeht
Die Baseline ist der Messwert vor dem Start. Sie ist die unscheinbarste und wichtigste Zutat des ganzen Nachweises, weil sie sich als Einzige nicht nachholen lässt. Ein halbes Jahr nach dem Start kann niemand mehr messen, wie es vorher war.
Der Aufwand ist überschaubar. Wählen Sie für den Anfang zwei oder drei Abläufe, nicht zwanzig. Erfassen Sie in den vier Wochen vor dem Start an echten Fällen, was Sie später vergleichen wollen:
| Größe | Wie erfassen | Wofür später |
|---|---|---|
| Bearbeitungszeit je Fall | Zehn bis zwanzig echte Fälle mit Stoppuhr oder Selbstnotiz, den Median bilden | Vergleichszeit je Ablauf |
| Zeit bis zur Antwort | Zeitstempel von Eingang und Antwort aus Postfach oder Ticketsystem | Vergleich der Gesamtdauer |
| Fälle je Woche | Zählen über vier Wochen | Einordnung der Nutzung |
| Nacharbeit und Rückfragen | Kleine Stichprobe: Wie oft kommt eine Korrektur oder Rückfrage? | Vergleich der Qualität |
Der Median ist hier besser als der Durchschnitt, weil einzelne Ausreißer, etwa ein Sonderfall, der einen halben Tag gedauert hat, den Durchschnitt verzerren. Die Zahl soll den typischen Fall abbilden.
Zwei Hinweise zur Praxis. Erstens: Messen Sie den Ablauf, nicht die Person. Es geht um die Frage, wie lange eine Kundenantwort dauert, nicht darum, wer langsamer ist. Zweitens: Sprechen Sie vorher mit den Beteiligten. Eine Stoppuhr ohne Erklärung weckt Misstrauen, und Misstrauen färbt die Messwerte.
Die Zeitachse ist ein Vorschlag, keine Vorschrift. Wichtig ist die Reihenfolge: erst Vorher-Wert, dann Start, dann eine Einlaufphase, die nicht gewertet wird, weil in den ersten Wochen alle noch lernen, und erst danach die Messphase. Die Zahlen aus der Einlaufphase gehören nicht in den Bericht, sonst bestrafen Sie das Projekt für etwas, das normal ist.
Qualität: was Rückmeldungen sagen und was nicht
Ob ein Ergebnis hilft, können nur Menschen beurteilen. Deshalb gibt es in TheroAI Rückmeldungen: Nach einem Lauf wird gefragt, ob das Ergebnis hilfreich war, und die Antwort fließt in die Auswertung ein. Im Reiter Feedback sehen Sie die Hilfreich-Quote, eine durchschnittliche Bewertung, die Zahl der Rückmeldungen insgesamt und der letzten sieben Tage sowie die am besten bewerteten Abläufe und die mit dem größten Verbesserungspotenzial. Bei zu wenigen Rückmeldungen weist die Auswertung selbst darauf hin, dass für einen Vergleich noch zu wenig Daten vorliegen. Das ist die richtige Haltung.
Dennoch ist diese Zahl die am leichtesten zu überschätzende. Vier Fallen:
- Geringer Rücklauf. Wenn von 180 Läufen nur 60 eine Rückmeldung haben, ist die Aussage über ein Drittel der Fälle. Nennen Sie immer beide Zahlen.
- Verzerrte Auswahl. Rückmeldungen geben vor allem Menschen, die sich sehr geärgert oder sehr gefreut haben. Die Mitte schweigt.
- Hilfreich ist nicht richtig. Ein flüssig formuliertes Ergebnis wirkt hilfreich, auch wenn eine Zahl darin falsch ist. Rückmeldungen ersetzen die Prüfung gegen die Quellen nicht.
- Bewertung hängt an der Erwartung. Wer viel erwartet, vergibt schlechtere Noten. Eine sinkende Quote kann also auch bedeuten, dass die Ansprüche gestiegen sind.
Als Gegenmittel hilft eine kleine Stichprobe mit Fachprüfung: Zehn Ergebnisse im Monat, zufällig gezogen, werden von einer Fachperson gegen die genannten Quellen geprüft. Das kostet eine Stunde und ergänzt die Rückmeldungen um ein Urteil, das nicht von der Laune des Tages abhängt.
Besonders aufschlussreich ist es, Erfolgsquote und Rückmeldung zusammen zu lesen. Die folgende Matrix zeigt, was die vier Kombinationen bedeuten.
Das gefährlichste Feld ist das mit hoher Erfolgsquote und schlechter Rückmeldung. Es sieht im Dashboard grün aus. Wer nur die Erfolgsquote berichtet, übersieht es. Typische Ursachen sind eine zu vage Anweisung im Agenten, fehlende oder veraltete Quellen oder eine Aufgabe, die sich für einen automatischen Ablauf nicht eignet.
Zeit bis zur Antwort: zwei Uhren
Die fünfte Kennzahl klingt einfach und wird am häufigsten mit etwas anderem verwechselt. Es gibt zwei Uhren. Die erste misst, wie lange ein Lauf arbeitet. Im Audit-Log steht sie in der Spalte Dauer, in der Produktaufnahme oben zum Beispiel als 2.8 Sekunden oder 1.6 Minuten, und die Statistik zeigt die durchschnittliche Dauer. Die zweite misst, wie lange ein Mensch auf die Antwort wartet. Zwischen beiden liegt alles, was Menschen tun und lassen: Eine Anfrage liegt im Postfach, ein Entwurf wartet auf Durchsicht, eine Freigabe steht aus.
Gerade bei Abläufen mit Freigabeschritt ist der Unterschied groß. Ein Freigabeschritt hat eine Frist, im Beispiel der Produktaufnahmen sind es 72 Stunden. Die reine Arbeitszeit des Laufs kann in wenigen Sekunden erledigt sein, die Antwort beim Kunden dauert trotzdem, bis jemand freigegeben hat. Ob die im Audit-Log gezeigte Dauer die Wartezeit auf eine Freigabe einschließt, sollten Sie an Ihren eigenen Läufen prüfen, bevor Sie sie als Laufzeit berichten. Das ist kein Mangel, sondern die Absicht eines Vier-Augen-Prinzips. Es heißt aber: Wer die Laufzeit als Zeit bis zur Antwort verkauft, rechnet sich schön.
Messen Sie die zweite Uhr deshalb dort, wo der Mensch sie spürt: am Zeitstempel der eingehenden Anfrage und am Zeitstempel der gesendeten Antwort, aus dem Postfach oder dem Ticketsystem. Dieselbe Messung haben Sie in der Baseline schon einmal gemacht. Auch hier gilt: Median statt Durchschnitt.
Die Grafik zeigt eine Beispielrechnung mit runden Annahmen, keine Messung. Sie macht aber sichtbar, was in der Praxis häufig passiert: Die Laufzeit der KI ist ein winziger Teil der Gesamtzeit. Der größere Hebel steckt im Warten. Wer die Zeit bis zur Antwort verkürzen will, schaut deshalb nicht nur auf die Maschine, sondern auch darauf, wer wann benachrichtigt wird und wie die Prüfung organisiert ist.
Von der Zahl zur Verbesserung: Muster, Audit-Log und Bericht
Kennzahlen sind kein Selbstzweck. Sie sind nur dann etwas wert, wenn sie zu Entscheidungen führen: einen Ablauf ausbauen, eine Anweisung schärfen, eine Anbindung reparieren, einen Pilot beenden. Dafür liefern die Auswertungen zwei weitere Bausteine.
Der Reiter Muster zeigt „Gelernte Muster“. Über „Analysieren“ wertet TheroAI Ausführungen aus und schlägt Muster vor, etwa eine bevorzugte Werkzeugwahl, eine wiederkehrende Entscheidungsregel oder ein Ablaufmuster. Zu jedem Muster steht, auf wie vielen Ausführungen es beruht, und ein Mensch bestätigt oder verwirft es. Das ist die richtige Arbeitsteilung: Das System findet Kandidaten, die Fachseite entscheidet. Ein Muster ist ein Hinweis aus den Läufen, kein Beweis, und die Zahl der zugrunde liegenden Ausführungen sagt, wie viel Gewicht es verdient.
Der zweite Baustein ist das Audit-Log als Beleg. Wenn im Quartalsgespräch jemand nachfragt, wie eine Zahl zustande kommt, lässt sich die Liste der Läufe filtern und als CSV exportieren. Die Zahl hat dann eine Herkunft. Das unterscheidet einen Nachweis von einer Folie.
Ein Monatsbericht muss dafür nicht lang sein. Eine Seite genügt, wenn sie diese fünf Dinge enthält:
- die fünf Kennzahlen mit dem Zeitraum und dem Vergleich zur Baseline
- bei jeder Zahl die Art: gemessen, geschätzt oder beurteilt
- die Zahl der Rückmeldungen im Verhältnis zur Zahl der Läufe
- die Annahmen hinter der geschätzten Zeitersparnis, einzeln aufgeführt
- eine Entscheidung oder Frage für den nächsten Monat
Der letzte Punkt ist der wichtigste. Ein Bericht, der nur beschreibt, wird gelesen und vergessen. Ein Bericht, der eine Entscheidung vorbereitet, wird gebraucht.
Eine Beispielrechnung, Schritt für Schritt
Die folgende Rechnung ist eine Beispielrechnung mit runden, ausgedachten Annahmen. Sie zeigt den Weg von der naiven zur belastbaren Zahl. Der Ablauf ist fiktiv: eine Kundenantwort vorbereiten und freigeben lassen, angelehnt an unsere Demo-Unterlagen mit dem erfundenen Fehler E-217 am Füller FL-200.
| Größe | Wert | Art |
|---|---|---|
| Läufe im Monat | 200 | Annahme |
| davon erfolgreich | 180 (Erfolgsquote 90 Prozent) | Annahme |
| Handarbeit je Anfrage vorher | 20 Minuten (Median aus der Baseline) | Annahme |
| Prüfen und Anpassen je Anfrage mit KI | 8 Minuten | Annahme |
| Rückmeldungen | 60 abgegeben, davon 48 hilfreich (80 Prozent) | Annahme |
| Zeit bis zur Antwort | vorher 6 Stunden, nachher 3 Stunden (Median) | Annahme |
Nun die Rechnung in drei Schritten:
| Schritt | Rechnung | Ergebnis |
|---|---|---|
| 1. Naiv: alle Läufe mal Vergleichszeit | 200 mal 20 Minuten = 4.000 Minuten | rund 67 Stunden |
| 2. Fehlgeschlagene Läufe abziehen | 20 mal 20 Minuten = 400 Minuten | minus rund 7 Stunden, bleiben 60 Stunden |
| 3. Prüfzeit abziehen | 180 mal 8 Minuten = 1.440 Minuten | minus 24 Stunden, bleiben 36 Stunden |
Aus 67 Stunden werden 36. Das ist immer noch ein ordentliches Ergebnis, und es ist eines, das einer Rückfrage standhält. Die 67 Stunden hätten bei der ersten kritischen Nachfrage nicht gehalten: Wo ist die Prüfzeit? Was ist mit den Läufen, die gescheitert sind?
Zur Einordnung der übrigen Werte: Bei 60 Rückmeldungen zu 180 erfolgreichen Läufen steht die Aussage „80 Prozent hilfreich“ auf einem Drittel der Fälle. Das ist ein brauchbares Signal, aber kein Freibrief. Die Zeit bis zur Antwort halbiert sich in diesem Beispiel von 6 auf 3 Stunden, und der größte Teil davon ist weiterhin Wartezeit. Und die 36 Stunden sind freie Kapazität, kein eingespartes Geld. Ob daraus Mehrleistung, kürzere Überstunden oder gar nichts wird, ist eine Entscheidung, keine Messung.
Datenschutz und Mitbestimmung: Messen ohne Kontrolle
Wer Nutzung misst, erzeugt Daten über Verhalten. Das ist unvermeidlich und in Ordnung, solange man bewusst damit umgeht. Das Audit-Log führt eine Spalte Person. Das Dashboard gruppiert nach Abteilungen. Für den Nachweis des Nutzens reicht fast immer die Ebene des Ablaufs und der Abteilung. Eine Rangliste einzelner Beschäftigter nach Nutzung brauchen Sie dafür nicht, und sie würde dem Vorhaben mehr schaden als nützen.
Praktisch heißt das: Legen Sie den Zweck der Auswertung vorher fest und schreiben Sie ihn auf. Klären Sie, wer welche Auswertung sehen darf. Und beziehen Sie den Betriebsrat früh ein. Technische Einrichtungen, die dazu geeignet sind, Verhalten oder Leistung von Beschäftigten zu überwachen, unterliegen nach § 87 Abs. 1 Nr. 6 des Betriebsverfassungsgesetzes der Mitbestimmung. Ob und wie das auf Ihre Konstellation zutrifft, ist eine Frage des Einzelfalls. Das ist keine Rechtsberatung, klären Sie den Einzelfall mit Ihrer Rechtsberatung.
Zum Ort der Daten: Die Datenhaltung erfolgt in Deutschland, die KI-Verarbeitung in der EU. Mehr dazu finden Sie auf der Seite zur Sicherheit. Entscheidend für die Kennzahlen ist ein anderer Punkt: Sie messen Abläufe, nicht Menschen, und Sie sagen das den Beteiligten, bevor Sie anfangen.
Was Sie daraus mitnehmen können
Wenn Sie den Nutzen einer Unternehmens-KI belegen müssen, helfen diese Schritte und Prüffragen:
- 1.Legen Sie vor dem Start zwei oder drei Abläufe fest und messen Sie vier Wochen lang den Vorher-Wert: Bearbeitungszeit, Zeit bis zur Antwort, Fälle je Woche und Nacharbeit, jeweils als Median.
- 2.Planen Sie eine Einlaufphase von etwa vier Wochen ein, die nicht in die Bewertung eingeht.
- 3.Prüfen Sie bei jeder Zahl, ob sie gemessen, geschätzt oder beurteilt ist, und schreiben Sie es dazu.
- 4.Zeigen Sie die Erfolgsquote nie ohne Qualität. Fragen Sie: Wie hoch ist die Rückmeldequote, und wer prüft stichprobenartig gegen die Quellen?
- 5.Rechnen Sie die Zeitersparnis netto: Fehlgeschlagene Läufe und Prüfzeit abziehen, die Annahmen einzeln aufführen und Kapazität nicht als Geld verbuchen.
- 6.Messen Sie die Zeit bis zur Antwort dort, wo der Mensch wartet, und nicht an der Laufzeit des Systems.
- 7.Klären Sie Zweck, Sichtbarkeit und Mitbestimmung, bevor die erste Auswertung entsteht.
Könnte jemand, der den Assistenten nie benutzt hat, anhand Ihres Berichts nachrechnen, wie die Zahlen zustande kamen?
Wenn die Antwort ja lautet, haben Sie einen Nachweis. Wenn nicht, haben Sie eine Behauptung, auch wenn sie stimmt. Unsere Position: Eine Unternehmens-KI muss ihren Nutzen nicht größer machen, als er ist. Sie muss ihn so zeigen, dass man ihm glauben kann, und dafür reichen fünf Zahlen, ein Vorher-Wert und die Bereitschaft, das Wort „geschätzt“ auszuschreiben.
Wenn Sie sehen möchten, wie die Auswertungen mit Dashboard, Audit-Log, Feedback und Mustern aussehen, zeigen wir sie Ihnen gern in einer Demo, ohne Verpflichtung und in Ihrem Tempo.
Thero live sehen
Buchen Sie eine kurze Demo. Sie sprechen direkt mit dem Gründerteam.