Stellen Sie sich eine Lenkungsrunde vor, in der über die Einführung einer Unternehmens-KI entschieden werden soll. Die IT-Leiterin sagt: „Nur offene Modelle, und zwar auf unseren eigenen Servern.“ Der Fachbereichsleiter hält dagegen: „Ich will das beste verfügbare Modell, egal wo es läuft.“ Die Datenschutzbeauftragte sagt nur einen Satz: „Hauptsache, nichts verlässt Europa.“ Alle drei haben ein berechtigtes Anliegen. Trotzdem endet die Sitzung ohne Entscheidung, weil jede und jeder eine andere Frage beantwortet.
Dieser Artikel sortiert diese Fragen. Unsere These: Modellwahl und Hosting sind keine Glaubensfrage, sondern mehrere getrennte Entscheidungen, die sich mit wenigen Kriterien treffen lassen: Standort, Qualität je Aufgabe, Tempo, Kosten und Austauschbarkeit. Dazu kommt eine zweite, praktische These: Für die Aufgaben eines Unternehmens gibt es selten ein einziges Modell, das überall die richtige Wahl ist. Wer je Aufgabe auswählt und die Plattform so baut, dass sich ein Modell später ersetzen lässt, vermeidet zwei Fehler zugleich: den Stillstand durch Grundsatzdebatten und die Abhängigkeit von einer einzigen Entscheidung.
Eine Vorbemerkung, die uns wichtig ist. Dieser Artikel bewertet keine Anbieter und keine einzelnen Modelle, und er nennt keine Benchmarks. Zahlen, die vorkommen, sind runde Annahmen in ausdrücklich gekennzeichneten Beispielrechnungen. Sie sind weder Messwerte noch Preise. Wo es um Recht geht, bleiben wir allgemein: Das ist keine Rechtsberatung, klären Sie den Einzelfall mit Ihrer Rechtsberatung.
Warum der Glaubenskrieg die falsche Frage stellt
Der Streit „offen gegen proprietär“ vermischt vier Fragen, die nichts miteinander zu tun haben müssen:
- Die Aufgabe: Was soll das Modell erledigen, und was passiert, wenn es sich irrt?
- Das Modell: Von wem stammt es, sind seine Gewichte (die Zahlenwerte des trainierten Modells) verfügbar, wie groß ist es?
- Der Betrieb: Wer lässt das Modell auf welcher Hardware laufen, Sie selbst, Ihr Plattformanbieter oder ein Dritter?
- Der Standort: Wo liegen die Daten, und wo werden sie verarbeitet?
Diese vier Fragen sind weitgehend unabhängig voneinander. Ein offenes Modell kann bei einem Betreiber in Frankfurt laufen oder in einem Rechenzentrum in einem Drittland. Ein proprietäres Modell kann über eine Schnittstelle in der EU erreichbar sein oder nicht. Wer „offen“ sagt und „sicher“ meint, hat zwei Fragen verwechselt. Wer „proprietär“ sagt und „Daten weg“ meint, ebenfalls.
Die Reihenfolge ist dabei nicht beliebig. Der Standort, mit allem, was Recht und Vertrag dazu verlangen, ist ein Muss-Kriterium: Er schließt Optionen aus, bevor man sie vergleicht. Erst innerhalb dessen, was erlaubt ist, wählen Sie nach Aufgabe, Modell und Betrieb. Wer die Reihenfolge umdreht und zuerst das „beste“ Modell sucht, steht später vor der Frage, ob er es überhaupt einsetzen darf.
| Entscheidung | Leitfrage | Typische Optionen |
|---|---|---|
| Standort (Muss-Kriterium) | Wo liegen die Daten, wo wird gerechnet, wer hat Zugriff? | Datenhaltung in Deutschland, KI-Verarbeitung in der EU, andere Regionen |
| Aufgabe | Was soll erledigt werden, und was kostet ein Fehler? | Einordnen, Antworten mit Quellen, Entwürfe, Zusammenfassen |
| Modell | Wie groß, unter welcher Lizenz, wie wird es aktualisiert? | offen oder proprietär, klein oder groß |
| Betrieb | Wer betreibt es, wer trägt Updates und Verfügbarkeit? | Sie selbst, Plattformanbieter, Partner |
Ein Hinweis zur Sprache: Wenn Menschen „Hosting“ sagen, meinen sie meist zwei Dinge auf einmal, nämlich den Betrieb der Plattform und den Betrieb des Modells. Beides kann an verschiedenen Orten und bei verschiedenen Unternehmen liegen. Genau deshalb lohnt sich die getrennte Betrachtung.
Offene und proprietäre Modelle: Was der Unterschied wirklich bedeutet
Zuerst die Begriffe. Bei einem offenen Modell sind die Gewichte verfügbar. Man kann das Modell also herunterladen und selbst oder bei einem Betreiber seiner Wahl laufen lassen. „Offen“ beschreibt allerdings keine einheitliche Lizenz. Manche Modelle dürfen nur unter Bedingungen kommerziell genutzt werden, manche haben Einschränkungen bei Verwendungszweck oder Unternehmensgröße. Lesen Sie deshalb die Lizenz des konkreten Modells, bevor Sie planen. Bei einem proprietären Modell erreichen Sie das Modell nur über die Schnittstelle des Herstellers oder eines von ihm zugelassenen Betreibers. Die Gewichte bleiben beim Hersteller.
Was folgt daraus für die Praxis? Offene Gewichte geben Ihnen Wahlfreiheit beim Betrieb und bei der Version. Sie können festlegen, wo das Modell läuft, und Sie können eine Version einfrieren, damit sich Antworten nicht ohne Ihr Zutun verändern. Dafür tragen Sie oder Ihr Betreiber die Hardware, Updates, Überwachung und Verfügbarkeit. Proprietäre Modelle nehmen Ihnen Betriebsaufwand ab und sind oft früher verfügbar. Dafür richten sich Standort, Versionswechsel und Laufzeit nach dem Angebot des Herstellers.
Keine der beiden Seiten ist von sich aus sicherer. Sicherheit entsteht aus Vertrag, Standort, Zugriffskontrolle und Betrieb, nicht aus dem Lizenztyp. Ein offenes Modell auf einer schlecht abgesicherten Maschine ist weniger sicher als ein proprietäres Modell mit vertraglich geregelter Verarbeitung in der EU, und umgekehrt kann ein sauber betriebenes offenes Modell die bessere Wahl sein. Der Lizenztyp sagt nur, welche Betriebsformen überhaupt möglich sind.
| Betriebsform | Kontrolle | Aufwand bei Ihnen | Worauf Sie achten sollten |
|---|---|---|---|
| Offenes Modell, eigener Betrieb | hoch | hoch | Hardware, Updates, Überwachung, Fachpersonal, Lizenz des Modells |
| Offenes Modell, bei einem Betreiber | mittel bis hoch | mittel | Standort und Unterauftragnehmer des Betreibers, Vertrag, Version einfrieren |
| Proprietäres Modell über Schnittstelle | geringer | gering | Region der Verarbeitung, Speicherung von Eingaben, Versionswechsel |
| Proprietäres Modell bei besonderer Vereinbarung | mittel | mittel bis hoch | Nur wenn der Hersteller es anbietet, Kosten und Laufzeit prüfen |
Die Tabelle ist eine Orientierung, kein Urteil. Welche Zeile für Sie passt, hängt davon ab, wie viel Betriebsaufwand Sie tragen wollen und können, und davon, was Ihr Standortkriterium zulässt.
Zur Einordnung von TheroAI: Wir sind ein verwaltetes Angebot. Wir betreiben die Plattform, die Datenhaltung liegt in Deutschland, die KI-Verarbeitung läuft in der EU. Welche Partner daran beteiligt sind und welche Zusagen vertraglich gelten, steht in unserem Auftragsverarbeitungsvertrag und auf der Sicherheitsseite. Dieser Artikel soll Ihnen helfen, dieselben Fragen an jedes Angebot zu stellen, auch an unseres.
Datenresidenz: Wo die Daten liegen und wo gerechnet wird
„Daten in Europa“ klingt nach einer Antwort, ist aber meist eine Abkürzung für zwei verschiedene Dinge. Die Datenhaltung beschreibt, wo Dokumente, Suchindizes, Gesprächsverläufe und Protokolle gespeichert sind. Die Verarbeitung beschreibt, wo das Modell die Textauszüge liest und die Antwort berechnet. Beides ist wichtig, und beides kann an verschiedenen Orten liegen. Unsere Formulierung dafür lautet: Datenhaltung in Deutschland, KI-Verarbeitung in der EU.
Warum trennen? Die Datenhaltung ist dauerhaft und umfangreich: Sie enthält alles, was Ihr Unternehmen an Wissen ablegt. Die Verarbeitung ist flüchtig und schmal: Das Modell bekommt nur die Auszüge, die für eine Frage nötig sind. Ein Assistent sollte dabei nur Textstellen weitergeben, die die fragende Person auch sonst sehen dürfte. Diese Prüfung gehört vor den Modellaufruf und nicht in die Höflichkeit des Modells. Wie das in der Praxis aussieht, beschreiben wir im Artikel zur Berechtigungs-Spiegelung.
Was eine Standortangabe beantwortet und was nicht, zeigt die folgende Tabelle.
| Angabe | Das beantwortet sie | Das beantwortet sie nicht |
|---|---|---|
| Datenhaltung in Deutschland | Wo Dokumente, Indizes und Protokolle gespeichert sind | Wo ein Modell die Auszüge verarbeitet |
| KI-Verarbeitung in der EU | In welchem Rechtsraum die Modelle laufen | Wer im Betrieb oder Support Zugriff hat, ob Eingaben gespeichert werden |
| Vertraglich vereinbarte Zero Retention | Dass Eingaben nicht gespeichert und nicht zum Training verwendet werden sollen | Wie Sie das prüfen können, dafür brauchen Sie Vertrag und Nachweise |
| Vertrag zur Auftragsverarbeitung nach Art. 28 DSGVO | Rollen und Pflichten von Auftraggeber und Auftragsverarbeiter | Ob Ihr Verwendungszweck im Einzelfall zulässig ist |
Aus der Tabelle folgt: Die Standortangabe ist ein guter Anfang, aber keine Prüfung. Sie ersetzt nicht die Fragen nach Zugriff, Speicherung und Vertrag. Diese sechs Fragen sollten Sie jedem Betreiber stellen, der Ihre Texte verarbeitet:
- In welchen Ländern und bei welchen Unterauftragnehmern laufen die Modelle, die Ihre Texte verarbeiten?
- Werden Eingaben oder Antworten gespeichert, und wenn ja, wie lange und wozu?
- Werden Ihre Daten zum Training verwendet, und steht die Antwort im Vertrag statt nur auf einer Webseite?
- Wer hat im Betrieb und im Support Zugriff auf Inhalte, und wird dieser Zugriff protokolliert?
- Wie erfahren Sie von einem Wechsel des Betreibers oder eines Unterauftragnehmers, und welche Fristen gelten für Ihren Widerspruch?
- Was geschieht mit Ihren Daten und Indizes, wenn der Vertrag endet?
Ein rechtlicher Rahmen gehört dazu, allerdings nur in Grundzügen. Verarbeitet ein Anbieter personenbezogene Daten in Ihrem Auftrag, ist in der Regel ein Vertrag zur Auftragsverarbeitung nach Art. 28 DSGVO erforderlich. Haben ein Betreiber oder seine Unterauftragnehmer ihren Sitz oder Zugriffsmöglichkeiten außerhalb der EU, entstehen zusätzliche Fragen zur Übermittlung in Drittländer, die Sie rechtlich prüfen lassen sollten. Das ist keine Rechtsberatung, klären Sie den Einzelfall mit Ihrer Rechtsberatung und Ihrer Datenschutzbeauftragten.
Wer sich dafür entscheidet, die Standortfrage hart als Muss-Kriterium zu behandeln, gewinnt Zeit: Aus der Liste der denkbaren Modelle und Betreiber fallen von vornherein alle heraus, die das Kriterium nicht erfüllen. Das verkürzt den Vergleich erheblich, weil Sie nur noch innerhalb des Erlaubten wählen.
Qualität je Aufgabe: Messen statt glauben
Die wichtigste Frage der Modellwahl lautet nicht „Welches Modell ist das beste?“, sondern „Welches Modell ist für diese Aufgabe gut genug?“. Aufgaben im Unternehmen unterscheiden sich erheblich in ihren Anforderungen. Eine Anfrage in die richtige Warteschlange einzuordnen ist etwas anderes, als einen Vertrag auf Abweichungen zu prüfen. Die Grafik zeigt eine beispielhafte Einschätzung solcher Anforderungsprofile. Es ist eine Einschätzung der Anforderungen an die Aufgabe, keine Messung von Modellen.
Ein fiktives Beispiel aus unseren Demo-Unterlagen macht das greifbar. Ein Kunde schreibt: „Der Füller FL-200 meldet Fehler E-217.“ Aus dieser einen Anfrage werden drei Aufgaben:
- 1.Einordnen: Gehört die Anfrage zum Service, wie dringlich ist sie? Die Ausgabe ist kurz, ein Fehler fällt schnell auf, weil ein Mensch die Warteschlange ohnehin sieht. Hier zählt Tempo.
- 2.Nachschlagen und antworten mit Quellen: Was sagen Wartungsbericht und Handbuch zu E-217? Hier zählt Treue zur Quelle, denn eine erfundene Abhilfe wäre schlimmer als keine Antwort. Ein Assistent sollte jede Aussage mit einer Quelle belegen und „nicht gefunden“ sagen, wenn nichts vorliegt.
- 3.Antwort entwerfen: Ton, Vollständigkeit und Bezug zur Quelle. Der Entwurf geht vor dem Versand an einen Menschen zur Freigabe, deshalb ist Zeitdruck gering.
Dieselbe Anfrage verlangt also drei verschiedene Profile. Ob dafür ein Modell oder mehrere gewählt werden, ist keine Weltanschauung, sondern eine Frage von Anforderung und Aufwand. Wie solche Fragen in der Praxis beantwortet werden, zeigt die Seite KI für den Anlagenbau an ähnlichen Beispielen.
Woher wissen Sie aber, ob ein Modell für eine Aufgabe gut genug ist? Nicht aus öffentlichen Ranglisten. Sie messen allgemeine Aufgaben auf fremden Daten und sagen wenig darüber, ob ein Modell Ihre Wartungsberichte, Ihre Fachbegriffe und Ihre Dokumentstruktur beherrscht. Ein Testsatz aus Ihrem eigenen Alltag ist aussagekräftiger. So gehen Sie vor:
- 1.Sammeln Sie echte Aufgaben. Für jeden Anwendungsfall zunächst 30 bis 50 Fälle aus dem Alltag, mit den Dokumenten, die dafür nötig sind.
- 2.Legen Sie vorab fest, was eine gute Antwort ist. Richtig, mit Quelle belegt, im gewünschten Format und, wo nichts vorliegt, ausdrücklich „nicht gefunden“.
- 3.Lassen Sie fachkundige Personen blind bewerten. Ohne zu wissen, welches Modell geantwortet hat.
- 4.Zählen Sie die Fehlerarten, nicht nur die Summe. Erfundene Angaben, fehlende Quellen und falsche Einordnungen wiegen unterschiedlich schwer.
- 5.Wiederholen Sie den Test bei jedem Modellwechsel. Auch größere Versionssprünge desselben Modells gehören dazu.
Die Zahl von 30 bis 50 Fällen ist ein praktischer Startpunkt, keine statistische Garantie. Sie genügt, um grobe Unterschiede zu erkennen, und ist klein genug, dass die Prüfung tatsächlich stattfindet. Wichtiger als die Größe des Testsatzes ist, dass er aus Ihrem Alltag stammt und dass Sie ihn aufbewahren, denn er wird später zur Grundlage jedes Modellwechsels.
Latenz: Woraus sich die Wartezeit zusammensetzt
„Schnell“ ist die Eigenschaft, die Beschäftigte am deutlichsten spüren. Gemeint sind dabei zwei verschiedene Zeiten: die Zeit bis zum ersten Wort, die darüber entscheidet, ob sich ein Chat zügig anfühlt, und die Zeit bis zur vollständigen Antwort, die vor allem bei langen Texten und bei Abläufen im Hintergrund zählt. Die Zeit setzt sich aus drei Teilen zusammen: dem Weg und der Suche, dem Start des Modells und der Erzeugung der Antwort.
Die folgende Beispielrechnung zeigt, wie sich diese Teile verhalten. Alle Werte sind runde Annahmen zur Veranschaulichung, keine Messwerte und keine Eigenschaften bestimmter Modelle. Die Einheit, in der Modelle Text verarbeiten, heißt Token und entspricht grob einem Wortbaustein.
| Annahme (Beispielrechnung) | Kleines Modell | Großes Modell |
|---|---|---|
| Weg im Netz innerhalb der EU | 0,05 s | 0,05 s |
| Suche und Rechteprüfung (nur bei Antworten mit Quellen) | 0,7 s | 0,7 s |
| Start des Modells bis zum ersten Wort | 0,3 s | 1,0 s |
| Erzeugungstempo | 100 Tokens je Sekunde | 40 Tokens je Sekunde |
| Länge einer Einordnung | 20 Tokens | 20 Tokens |
| Länge einer Antwort mit Quellen | 400 Tokens | 400 Tokens |
Daraus ergeben sich vier Fälle:
| Aufgabe | Modell | Erstes Wort nach | Vollständig nach |
|---|---|---|---|
| Anfrage einordnen | klein | 0,35 s | 0,55 s |
| Anfrage einordnen | groß | 1,05 s | 1,55 s |
| Antwort mit Quellen | klein | 1,05 s | 5,05 s |
| Antwort mit Quellen | groß | 1,75 s | 11,75 s |
Zum Nachrechnen: Bei der Antwort mit dem großen Modell sind es 0,05 plus 0,7 plus 1,0 Sekunden bis zum ersten Wort, also 1,75 Sekunden. Dann werden 400 Tokens mit 40 Tokens je Sekunde erzeugt, das sind 10 Sekunden, zusammen 11,75 Sekunden.
Drei Dinge fallen auf. Erstens: Bei der langen Antwort macht die Erzeugung den größten Teil der Zeit aus, nicht der Weg zum Rechenzentrum. Selbst wenn der Weg im Netz in dieser Rechnung zehnmal so lang wäre, also 0,5 statt 0,05 Sekunden, stiege die Gesamtzeit des großen Modells nur von 11,75 auf 12,2 Sekunden. Innerhalb der EU entscheiden über das Tempo deshalb meist Modellgröße und Antwortlänge, kaum der Standort. Zweitens: Wenn Antworten schrittweise erscheinen, zählt für das Gefühl von Tempo vor allem das erste Wort. Das ist bei 1,05 oder 1,75 Sekunden ein deutlicher Unterschied, aber kein Bruch. Drittens: Bei kurzen Aufgaben wie dem Einordnen dominiert der Start des Modells. Ein kleines Modell ist hier nicht nur günstiger, sondern auch spürbar schneller.
Was folgt daraus für die Auswahl? Unterscheiden Sie interaktive und nachgelagerte Aufgaben. Ein Chat, in dem jemand auf die Antwort wartet, verlangt ein schnelles erstes Wort. Ein Ablauf im Hintergrund, der etwa einen Antwortentwurf erstellt und danach auf eine Freigabe wartet, kann sich ein langsameres, sorgfältigeres Modell leisten, weil die Freigabe ohnehin Zeit braucht. Rechnen Sie außerdem nicht nur mit dem Idealfall: Unter Last, bei Warteschlangen und bei langen Dokumenten verändern sich die Zeiten. Messen Sie deshalb mit Ihrem Testsatz unter realistischen Bedingungen.
Kosten: Auswahl je Aufgabe statt ein Modell für alles
Nicht jede Anfrage braucht dasselbe Modell, und Modelle unterscheiden sich im Preis. Daraus entsteht ein Hebel: Wenn ein großer Teil der Anfragen einfach ist, lässt sich dieser Teil mit einem kleineren und günstigeren Modell bearbeiten, und das große Modell bleibt den anspruchsvollen Fällen vorbehalten. Wie groß der Hebel sein kann, zeigt wieder eine Beispielrechnung mit runden Annahmen. Die Preisfaktoren sind keine Preise, sondern Rechenwerte, mit denen sich das Prinzip zeigen lässt.
| Stufe (Beispielrechnung) | Anteil | Anfragen im Monat | Preisfaktor je Anfrage | Recheneinheiten |
|---|---|---|---|---|
| Einfach: kleines Modell | 70 Prozent | 7.000 | 1 | 7.000 |
| Mittel: mittleres Modell | 25 Prozent | 2.500 | 4 | 10.000 |
| Anspruchsvoll: großes Modell | 5 Prozent | 500 | 10 | 5.000 |
| Summe | 100 Prozent | 10.000 | 22.000 |
Zum Vergleich: Läuft jede der 10.000 Anfragen mit dem großen Modell, sind es 10.000 mal 10, also 100.000 Recheneinheiten. Die Auswahl je Aufgabe kommt mit 22.000 aus, das sind 22 Prozent. Läuft alles mit dem kleinen Modell, sind es 10.000 Einheiten, aber dann bekommen auch die anspruchsvollen Fälle ein Modell, das dafür nicht gedacht war.
Wie belastbar ist diese Rechnung? Sie hängt an zwei Annahmen, und beide sollten Sie vor einer Entscheidung prüfen. Die erste ist die Verteilung der Anfragen. Ob bei Ihnen 70 Prozent der Fälle einfach sind, zeigt nur Ihr eigener Bestand, zum Beispiel eine Stichprobe aus echten Anfragen. Die zweite ist die Einordnung selbst: Sie braucht ein Verfahren, das erkennt, welche Stufe passt, und dieses Verfahren kann sich irren. Ein Stresstest dafür: Läuft jede zehnte einfache Anfrage nachträglich noch einmal mit dem großen Modell, kommen 700 mal 10, also 7.000 Einheiten hinzu. Das sind 29.000 Einheiten oder 29 Prozent des Vergleichswerts. Die Auswahl je Aufgabe bleibt in dieser Rechnung deutlich günstiger, aber der Vorsprung ist kleiner als im ersten Fall.
Zwei Einschränkungen gehören dazu. Erstens: Modellkosten sind nur ein Teil der Gesamtkosten einer Einführung. Anbindung, Datenaufbereitung, Schulung und Betrieb kommen hinzu und sind oft größer als die Modellzeile. Wie sich der Nutzen im eigenen Betrieb grob rechnen lässt, können Sie mit dem ROI-Rechner ausprobieren. Zweitens: Mehrere Modelle bedeuten mehr Verwaltungsaufwand. Jede zusätzliche Stufe will getestet, überwacht und vertraglich geregelt werden. Beginnen Sie deshalb mit zwei Stufen, nicht mit fünf, und ergänzen Sie erst dann, wenn der Testsatz einen Nutzen zeigt.
Austauschbarkeit: Das Modell wird wechseln, der Prozess sollte bleiben
Ein Gedankenexperiment für Ihre nächste Lenkungsrunde:
Das Modell, das Sie heute auswählen, wird in zwei Jahren eingestellt, erheblich teurer oder von einem besseren abgelöst. Was müssten Sie dann ändern, und wie lange würde es dauern?
Wenn die Antwort lautet „alles“, haben Sie sich festgelegt, obwohl Sie sich nur für ein Modell entscheiden wollten. Abhängigkeiten entstehen an mehreren Stellen, und nicht alle sind offensichtlich:
- Anweisungen: Formulierungen, die für ein Modell geschrieben wurden, verhalten sich bei einem anderen anders.
- Suchindex: Die Zahlenvektoren, mit denen Dokumente gefunden werden, stammen von einem Einbettungsmodell. Wechselt dieses Modell, muss in der Regel neu indexiert werden, was Zeit und Rechenaufwand kostet.
- Ausgabeformate: Tabellen, Gliederungen und Quellenangaben müssen in der neuen Umgebung genauso erscheinen.
- Verträge: Laufzeit, Kündigungsfristen und die Frage, in welchem Format Sie Ihre Daten zurückbekommen.
- Gewohnheiten: Menschen haben sich auf Antwortstil und Tempo eingestellt.
Die wirksamste Gegenmaßnahme ist architektonisch: Alles, was sicher sein muss, gehört in feste Regeln der Plattform und nicht in das Verhalten des Modells. Berechtigungen, Quellenangaben und Freigaben sollten gelten, egal welches Modell gerade antwortet. Bei TheroAI sind sie feste Bestandteile der Plattform, und das Modell ist die austauschbare Schicht darunter. Ein Beispiel dafür zeigt der Freigabe-Schritt im Workflow-Editor: Titel, freigebende Person und Frist von 72 Stunden sind am Schritt festgelegt, unabhängig davon, welches Modell den Entwurf geschrieben hat.
Mehr zu solchen Abläufen steht auf der Seite zu den Workflows. Für den Modellwechsel selbst empfiehlt sich ein Vorgehen in vier Schritten, das die Qualität je Aufgabe im Blick behält: Testsatz sichern, das neue Modell parallel laufen lassen, je Aufgabe vergleichen und erst dann schrittweise umschalten.
Die folgende Tabelle zeigt, was bei einem Wechsel gleich bleibt und was Sie neu prüfen sollten.
| Bereich | Bleibt gleich | Neu prüfen |
|---|---|---|
| Berechtigungen und Quellen | Feste Regeln der Plattform | Ob Quellenangaben auch im neuen Modell vollständig erscheinen |
| Freigaben | Schritt, Frist, freigebende Personen | Ob Entwürfe in Ton und Format zum bisherigen Stand passen |
| Suchindex | Unverändert, solange das Einbettungsmodell bleibt | Neuindexierung, wenn das Einbettungsmodell wechselt |
| Protokollierung | Audit-Log der Läufe | Was der neue Betreiber seinerseits protokolliert |
| Anweisungen | Aufgabenbeschreibungen | Formulierungen mit dem Testsatz neu prüfen |
Ein Punkt gehört in die Abstimmung mit dem Betriebsrat, wenn Sie einen haben: Ein Modellwechsel kann ändern, was protokolliert wird und wer was auswerten kann. Nach § 87 Abs. 1 Nr. 6 Betriebsverfassungsgesetz hat der Betriebsrat mitzubestimmen bei der Einführung und Anwendung technischer Einrichtungen, die dazu bestimmt sind, das Verhalten oder die Leistung der Beschäftigten zu überwachen. Ob das im Einzelfall zutrifft, klärt Ihre Rechtsberatung.
Fünf typische Fehler bei der Modellwahl
Aus den bisherigen Abschnitten lassen sich fünf Muster ableiten, die in der Praxis immer wieder auftauchen:
- Das größte Modell für alles. Es ist bequem und für einfache Aufgaben unnötig teuer und langsam.
- Das kleinste Modell für alles. Es spart am meisten und fällt bei den anspruchsvollen Aufgaben auf, meist dann, wenn es am meisten schadet.
- Standort nur auf der Webseite geprüft. Eine Angabe auf einer Seite ersetzt weder Vertrag noch die Frage nach Zugriff und Speicherung.
- Ranglisten statt eigener Tests. Allgemeine Vergleiche sagen wenig über Ihre Dokumente und Ihre Fachbegriffe.
- Kein Rückweg geplant. Wer nicht weiß, wie ein Wechsel abläuft, hat sich schon festgelegt.
Hinter allen fünf steckt dasselbe Muster: Eine Entscheidung wird als endgültig behandelt, obwohl sie es nicht sein muss. Die Gegenmittel sind ebenfalls dieselben, nämlich ein eigener Testsatz, ein klares Muss-Kriterium und ein beschriebener Wechselweg.
Unsere Position
Modellwahl ist eine Ingenieursaufgabe mit Kriterien und keine Frage der Zugehörigkeit. Wir halten es für richtig, den Standort zuerst festzulegen, danach je Aufgabe zu entscheiden und das Modell als austauschbare Schicht zu behandeln. Dann ist es nicht mehr dramatisch, ob heute ein offenes oder ein proprietäres, ein kleines oder ein großes Modell antwortet, denn Berechtigungen, Quellen und Freigaben gelten ohnehin. Wer das so aufbaut, kann Modelle nach Qualität, Tempo und Kosten wählen und später wechseln, ohne Prozesse neu zu erfinden.
Wir wissen, dass sich die Modelllandschaft schnell verändert. Genau deshalb halten wir feste Rahmenbedingungen für wertvoller als jede Momentaufnahme: ein Standortkriterium, ein Testsatz aus Ihrem Alltag und ein Wechselweg.
Was Sie daraus mitnehmen können
Acht Prüffragen, die Sie schon in der nächsten Runde stellen können:
- Haben wir den Standort als Muss-Kriterium festgelegt, getrennt nach Datenhaltung und Verarbeitung?
- Wissen wir, in welchen Ländern und bei welchen Unterauftragnehmern unsere Texte verarbeitet werden, und steht das im Vertrag?
- Haben wir unsere Aufgaben aufgelistet und je Aufgabe festgehalten, was ein Fehler kostet?
- Besitzen wir einen Testsatz aus echten Fällen, mit dem wir jedes Modell vergleichen können?
- Wissen wir, wie sich Antwortzeit zusammensetzt, und unterscheiden wir interaktive von nachgelagerten Aufgaben?
- Haben wir mit unserer eigenen Verteilung der Anfragen gerechnet statt mit einem Pauschalwert?
- Gelten Berechtigungen, Quellenangaben und Freigaben unabhängig vom Modell?
- Wissen wir, wie ein Modellwechsel abläuft, einschließlich Neuindexierung, Vertrag und Abstimmung mit dem Betriebsrat?
Wenn Sie die Fragen an einem konkreten Anwendungsfall durchgehen möchten, ist eine Demo eine ruhige Gelegenheit, TheroAI mit Ihren eigenen Beispielen zu sehen und die offenen Punkte zu besprechen. Ohne Eile: Sie können die Prüffragen auch zunächst allein beantworten.
Thero live sehen
Buchen Sie eine kurze Demo. Sie sprechen direkt mit dem Gründerteam.