In fast jedem Auswahlgespräch kommt die Frage: Welches Modell nutzen Sie? Dahinter steht die verständliche Annahme, es gebe ein bestes. Die Annahme ist aus zwei Gründen unpraktisch. Erstens hängt die Antwort von der Aufgabe ab. Zweitens ändert sie sich schneller, als ein Auswahlprozess dauert.

Wer heute ein Modell auswählt und die Lösung darauf festlegt, hat in zwölf Monaten ein Problem. Sinnvoller ist es, Kriterien zu haben – und eine Architektur, in der ein Wechsel keine Neuentwicklung bedeutet.

Die Eigenschaften, auf die es ankommt

Aufgabenpassung

Modelle unterscheiden sich in dem, worin sie stark sind. Manche formulieren besonders gut, andere sind zuverlässiger bei logischen Ableitungen, wieder andere bei Code oder beim Auswerten sehr langer Dokumente. Für ein Unternehmen, das überwiegend Texte zusammenfasst und beantwortet, gelten andere Anforderungen als für eines, das Fachlogik prüfen lässt.

Kontextlänge

Wie viel Text kann das Modell gleichzeitig berücksichtigen? Das entscheidet, ob ein längerer Vertrag oder ein Ausschreibungskonvolut in einem Stück verarbeitet werden kann oder in Abschnitten. Für Dokumentenarbeit ist das ein handfestes Kriterium.

Sprachqualität im Deutschen

Ein Punkt, der in internationalen Vergleichen gern untergeht. Die Qualität im Deutschen – Fachsprache, Behördendeutsch, Höflichkeitsformen – unterscheidet sich deutlicher zwischen Modellen als im Englischen. Wer überwiegend deutsche Texte erzeugt, sollte genau das testen und sich nicht auf allgemeine Ranglisten verlassen.

Kosten und Geschwindigkeit

Leistungsfähigere Modelle sind teurer und langsamer. Für einen Assistenten, der auf eine Frage antwortet, zählt Reaktionszeit. Für eine nächtliche Auswertung von tausend Dokumenten zählt der Preis pro Vorgang. Es ist völlig legitim, in einer Lösung mehrere Modelle einzusetzen: ein schnelles für einfache Aufgaben, ein starkes für anspruchsvolle.

Verarbeitungsort und Vertragslage

Für deutsche Unternehmen häufig das ausschlaggebende Kriterium – und dasjenige, das die Auswahl am stärksten einschränkt. Wo läuft das Modell, wer ist Vertragspartner, werden Inhalte gespeichert oder zum Training verwendet? Ein fachlich etwas schwächeres Modell mit klarer Rechtslage ist in vielen Fällen die bessere Wahl als ein stärkeres mit ungeklärter.

Offene Gewichte oder geschlossener Dienst

Modelle mit frei verfügbaren Gewichten lassen sich im eigenen Rechenzentrum betreiben. Das bietet maximale Kontrolle und ist bei besonders schutzwürdigen Daten manchmal die einzige Option. Der Preis ist der Betriebsaufwand: Hardware, Aktualisierung, Verfügbarkeit, Fachpersonal. Für die meisten mittelständischen Unternehmen ist das kein guter Tausch – für einige ist es alternativlos.

Warum Ranglisten wenig helfen

Öffentliche Vergleichstests messen standardisierte Aufgaben. Ihr Unternehmen hat keine standardisierten Aufgaben. Ein Modell, das in Prüfungsaufgaben brilliert, kann bei Ihren Serviceberichten schwächer abschneiden als ein anderes, das in keiner Rangliste vorn liegt.

Hinzu kommt: Der Abstand zwischen den führenden Modellen ist bei alltäglichen Büroaufgaben inzwischen kleiner als der Unterschied, den eine gute Anbindung an Ihre Daten macht. Ein schwächeres Modell mit Zugriff auf Ihre Dokumente schlägt ein stärkeres ohne diesen Zugriff in nahezu jedem praktischen Fall.

Der eigene Test – so geht er

Statt Ranglisten zu lesen, bauen Sie sich einen kleinen eigenen Maßstab. Der Aufwand liegt bei ein bis zwei Tagen und ist die beste Investition im gesamten Auswahlprozess.

  1. Zwanzig bis dreißig echte Aufgaben sammeln. Aus dem Alltag der betroffenen Abteilung, mit der bekannten richtigen Antwort. Unbedingt auch die schwierigen Fälle einbeziehen – Tabellen, Scans, mehrdeutige Formulierungen.
  2. Bewertungsmaßstab festlegen. Was ist eine gute Antwort? Fachlich richtig, vollständig, im richtigen Ton, mit Quellenangabe. Legen Sie das vorher fest, nicht hinterher.
  3. Blind bewerten lassen. Die Fachleute sehen die Antworten, nicht den Namen des Modells. Das verhindert, dass Markenwahrnehmung das Urteil bestimmt.
  4. Die Fehler ansehen, nicht nur die Quote. Ein Modell, das bei Unsicherheit nachfragt, ist im Betrieb besser als eines, das mit derselben Trefferquote selbstbewusst falsch antwortet.

Die eigentliche Empfehlung: Wechselbarkeit

Wichtiger als die Wahl selbst ist die Frage, wie teuer eine spätere Änderung wird. Die Entwicklung ist schnell; welches Modell in zwei Jahren am besten passt, weiß heute niemand.

Achten Sie deshalb bei der Auswahl einer Plattform gezielt darauf:

  • Lässt sich das zugrunde liegende Modell wechseln, ohne die Lösung neu aufzubauen?
  • Können unterschiedliche Aufgaben unterschiedliche Modelle nutzen?
  • Bleiben Ihre Konfiguration, Ihre Vorlagen und Ihre Anbindungen bei einem Wechsel erhalten?
  • Wer entscheidet über einen Modellwechsel – Sie oder der Anbieter? Und werden Sie vorher informiert?

Die letzte Frage wird selten gestellt und ist im Betrieb relevant: Ein stillschweigend geändertes Modell kann das Verhalten eines eingespielten Ablaufs verändern.

Was das praktisch bedeutet

Für die meisten mittelständischen Unternehmen lautet die vernünftige Haltung: Legen Sie sich nicht auf ein Modell fest, sondern auf eine Architektur, die den Wechsel erlaubt. Investieren Sie Ihre Energie in das, was dauerhaft wirkt – die Anbindung an Ihre Daten, ein sauberes Rechtekonzept, gepflegte Inhalte und geschulte Mitarbeiter.

Diese vier Dinge behalten ihren Wert, egal welches Modell in zwei Jahren das beste ist. Genau deshalb halten wir unsere Plattform bewusst modelloffen – und beantworten die Frage „Welches Modell nutzen Sie?“ am liebsten mit einer Gegenfrage: Für welche Aufgabe?

Warum mehrere Modelle nebeneinander sinnvoll sind

In der Praxis ist die Frage selten „welches Modell“, sondern „welches wofür“. Eine typische Aufteilung in einem mittelständischen Einsatz sieht so aus:

Ein schnelles, günstiges Modell für einfache, häufige Aufgaben: Klassifizieren von Anfragen, kurze Zusammenfassungen, Formulierungshilfen. Hier zählt Reaktionszeit, und der Qualitätsunterschied ist gering.

Ein leistungsfähiges Modell für anspruchsvolle Aufgaben: längere Dokumente auswerten, Widersprüche finden, mehrschrittige Ableitungen. Hier zählt Genauigkeit, und die höheren Kosten fallen bei geringerer Häufigkeit kaum ins Gewicht.

Gegebenenfalls ein spezialisiertes Modell für einen bestimmten Zweck – etwa das Einlesen von Dokumenten und Tabellen.

Eine Plattform, die diese Aufteilung erlaubt, ist im Betrieb günstiger und besser als eine, die alles über ein Modell abwickelt.

Was ein Modellwechsel im Betrieb bedeutet

Ein Punkt, der bei der Auswahl selten bedacht wird: Ein Modellwechsel verändert das Verhalten eingespielter Abläufe. Antworten werden anders formuliert, Vorlagen liefern leicht andere Ergebnisse, ein Ablauf, der zuverlässig lief, braucht eine Nachjustierung.

Klären Sie deshalb zwei Dinge vertraglich: ob Sie über einen Modellwechsel vorab informiert werden und ob Sie ihn für Ihre Umgebung zeitlich steuern können. Und behalten Sie Ihre Testliste – sie ist nach einem Wechsel das schnellste Mittel, um festzustellen, ob noch alles trägt.

Häufige Fragen

Wie oft sollten wir die Modellwahl überprüfen?

Einmal jährlich reicht, plus anlassbezogen, wenn sich Anforderungen ändern. Häufiger zu wechseln kostet mehr Nachjustierung, als es an Qualität bringt.

Sind größere Modelle immer besser?

Nein. Für viele Büroaufgaben liefern kleinere, schnellere Modelle praktisch gleichwertige Ergebnisse bei deutlich geringeren Kosten. Der Unterschied wird erst bei komplexen Ableitungen und sehr langen Dokumenten spürbar.

Was ist mit Modellen, die wir selbst betreiben?

Sinnvoll bei besonders schutzwürdigen Daten oder wenn regulatorische Vorgaben es verlangen. Kalkulieren Sie den Betriebsaufwand ehrlich – Hardware, Aktualisierung, Verfügbarkeit, Fachpersonal – und vergleichen Sie ihn mit dem Zugewinn an Kontrolle.

Wie testen wir die deutsche Sprachqualität?

Mit Ihren eigenen Texten: einem Kundenschreiben, einem Fachabschnitt, einem behördlichen Text. Lassen Sie die Ergebnisse blind von Menschen bewerten, die diese Texte sonst schreiben. Das dauert einen halben Tag und ist aussagekräftiger als jede Rangliste.

Ein Testprotokoll zum Nachbauen

Der eigene Test ist die einzige belastbare Grundlage. Damit er nicht in Geschmacksurteilen endet, hilft ein festes Protokoll. Der Aufwand liegt bei ein bis zwei Tagen.

Schritt 1 – Aufgaben zusammenstellen. Zwanzig bis dreißig echte Vorgänge aus dem Alltag der betroffenen Abteilung, mit der jeweils richtigen Antwort. Mischen Sie bewusst: einfache Fälle, typische Fälle, Sonderfälle, und drei bis fünf Fragen, deren Antwort nachweislich nicht in Ihren Unterlagen steht.

Schritt 2 – Bewertungsraster festlegen. Vier Kriterien mit je null bis zwei Punkten: fachliche Richtigkeit, Vollständigkeit für den Zweck, Tonalität und Form, Quellenangabe. Ein fünftes Kriterium nur für die Fälle ohne Antwort im Bestand: Hat das System die Wissenslücke erkannt und benannt? Dieses Kriterium doppelt gewichten – es sagt mehr über die Betriebstauglichkeit aus als alles andere.

Schritt 3 – Blind bewerten. Die Fachleute sehen die Antworten ohne Angabe des Modells. Das verhindert, dass Markenwahrnehmung das Urteil bestimmt – ein Effekt, der in der Praxis erstaunlich stark ist.

Schritt 4 – Fehler auswerten, nicht nur zählen. Sortieren Sie die Fehltreffer nach Ursache: fehlendes Dokument, veraltetes Dokument, schlecht eingelesenes Format, falsche Fundstelle, oder tatsächlich schwaches Modell. Erfahrungsgemäß entfällt der kleinere Teil auf die letzte Kategorie – und das ist die wichtigste Erkenntnis des ganzen Tests.

Schritt 5 – Protokoll aufbewahren. Dieselbe Liste dient später der Abnahme, jeder Erweiterung und der Prüfung nach einem Modellwechsel.

Kostenmodelle verstehen

Sprachmodelle werden intern nach Textmenge abgerechnet, aufgeteilt in eingehenden und ausgehenden Text. Für Sie ist das je nach Tarif sichtbar oder nicht – relevant wird es in drei Situationen.

Bei der Verarbeitung langer Dokumente steigt der eingehende Anteil stark. Ein Ausschreibungskonvolut kostet ein Vielfaches einer kurzen Frage.

Bei Systemen mit Dokumentenanbindung wird zu jeder Frage zusätzlicher Kontext mitgegeben. Das ist der Grund, warum ein angebundener Assistent teurer ist als ein reiner Chat – und warum die Größe des mitgegebenen Kontexts eine Stellschraube ist.

Bei automatisierten Abläufen im Hintergrund summiert sich der Verbrauch ohne menschliche Bremse. Hier ist eine Obergrenze nicht optional.

Fragen Sie deshalb konkret: Gibt es eine Verbrauchsgrenze, was passiert bei Erreichen, und bekomme ich eine Auswertung, aus der hervorgeht, welcher Anwendungsfall wie viel verursacht? Ohne die letzte Angabe können Sie eine unerwartete Rechnung nicht einmal zuordnen.

Was der Kontext kostet – und warum das eine Stellschraube ist

Ein technischer Zusammenhang mit direkter Auswirkung auf Kosten und Qualität: Bei jeder Anfrage an ein angebundenes System wird nicht nur Ihre Frage übergeben, sondern auch die gefundenen Dokumentauszüge. Je mehr Auszüge mitgegeben werden, desto teurer und langsamer wird die Anfrage.

Interessant ist, dass mehr Kontext nicht automatisch bessere Antworten liefert. Ab einer gewissen Menge nimmt die Genauigkeit sogar ab, weil relevante Stellen zwischen irrelevanten untergehen. Die Zahl der mitgegebenen Auszüge ist deshalb eine Einstellung, die man testen sollte, statt sie auf Maximum zu setzen.

Fragen Sie Ihren Anbieter, ob diese Größe konfigurierbar ist und wie sie voreingestellt ist. Wenn die Antwort lautet, das sei fest verdrahtet, ist das ein Hinweis darauf, wie viel Feinsteuerung Sie insgesamt zu erwarten haben.

Sie möchten wissen, ob sich das in Ihrem Unternehmen rechnet? Wir sehen uns einen konkreten Ablauf an und sagen Ihnen auch dann offen Bescheid, wenn sich der Einsatz nicht lohnt.

Ihre sichere KI-Plattform für den Mittelstand. Sicher. Intelligent. Integriert. Individuelle Datenbankanbindung, persönlich betreut.

novendix GmbH · Industriestraße 6 · 91126 Schwabach
Standorte: Schwabach · Weißenburg · Nürnberg
Ein Unternehmen der L&S Lange & Schermer Unternehmensgruppe

© 2026 novendix GmbH — Alle Rechte vorbehalten.Ein neues Zeitalter des Denkens · Entwickelt für den deutschen Mittelstand 🇩🇪