# Warum dasselbe KI-Modell in Anwendungen unterschiedliche Ergebnisse liefert

> Warum kann dasselbe KI-Modell in Produkten so unterschiedlich arbeiten? Anwendung, Kontext, Werkzeuge, Berechtigungen und Evaluierung prägen das Ergebnis.

> 💡 **Kurz gesagt:**
> - **Ein Modellname beschreibt nicht die vollständige Arbeitsfähigkeit eines KI-Produkts.** Kontext, Werkzeuge, Berechtigungen und Arbeitsablauf prägen das Ergebnis mit.
> - **Dasselbe Modell kann in verschiedenen Anwendungen unterschiedliche Aufgaben erledigen.** Es kann in einem Produkt Text erzeugen und in einem anderen mit Quellen und Software eine Aufgabe abschließen.
> - **Testen Sie Produkte an Ihrer eigenen Arbeit.** Abgeschlossene Arbeit, Korrekturen, Kosten, Fehlerverhalten und Befugnisgrenzen gehören gemeinsam in die Bewertung.

Stellen Sie sich vor, ein Vertriebsteam bittet zwei KI-Produkte, dasselbe Kundenangebot vorzubereiten. Das erste macht aus Gesprächsnotizen sprachlich ausgefeilten Text. Das zweite prüft aktuelle Preise und die Kundenhistorie, erkennt, dass der Rabatt Freigabe verlangt, und hängt den Entwurf an den richtigen CRM-Datensatz. Das Team könnte annehmen, das zweite nutze das fähigere Modell. Beide könnten dasselbe nutzen.

Der Unterschied kann aus Kontext, Werkzeugen, Handlungsbefugnis und der Art der Prüfung entstehen. Ich habe bereits argumentiert, dass Unternehmen mit dem [Geschäftsproblem statt mit einem KI-Modell](/de/mit-dem-geschaeftsproblem-beginnen-nicht-mit-dem-ki-modell){target="_blank" rel="noopener"} beginnen sollten. Sind gewünschtes Ergebnis und Abnahmekriterien klar, ist ein Modellvergleich sinnvoll. Doch auch dann ist das Modell nicht das Einzige, was bewertet wird.

![Derselbe Modellkern durchläuft Kontext-, Werkzeug-, Berechtigungs- und Ablaufebenen bis zu einem geprüften Datensatz](/images/inline-model-application-harness/capability-layers.webp)

## Modell, Anwendung und Harness sind nicht dasselbe

Ein KI-Produkt lässt sich als vier Schichten betrachten:

| Schicht | Rolle im Angebotsbeispiel |
| --- | --- |
| Modell | interpretiert Notizen und erzeugt Text |
| Anwendung | lässt Nutzer Arbeit beginnen und Ergebnis prüfen |
| Harness | verwaltet Kontext, Werkzeuge, Berechtigungen und Abbruchbedingungen |
| Geschäftsablauf | definiert menschliche Verantwortung und das abgeschlossene Ergebnis |

Der *Harness* ist die Betriebsschicht um das Modell. Er bestimmt, welche Informationen das Modell sehen darf, welche Werkzeuge es aufrufen darf, was nach einem Fehler geschieht und wann menschliche Freigabe nötig ist. Diese Grenzen liegen nicht in jedem Produkt an derselben Stelle. Die Unterscheidung hilft, die Entscheidung zu finden, die den Ergebnisunterschied erzeugt hat.

## Das Modell nicht mit dem ganzen Produkt verwechseln

Dasselbe Modell kann in einem leeren Chatfenster, einer Rechercheanwendung und einem an Software-Werkzeuge angeschlossenen Agentensystem unterschiedliche Arbeit leisten. Eine Anwendung nutzt nur vom Nutzer gelieferten Text. Eine andere durchsucht aktuelle Quellen, bewahrt Zustand über Schritte, legt Datensätze an und verlangt bei Bedarf Freigabe.

Produktentwicklungsleitfäden behandeln Kontext, Werkzeugnutzung, Freigaben, Fehlerwiederherstellung und Gedächtnis ebenfalls als Teile des Systems um das Modell. Rohfähigkeit eines Modells und die Arbeit, die ein Produkt leisten kann, sind nicht dasselbe.

Ein Modellname ist daher nützlich, aber unvollständig. Auf welche aktuelle und unternehmensspezifische Information kann es zugreifen? Welche Handlungen darf es ausführen? Erzwingt Software Berechtigungen? Stoppt es nach Fehlern? Wer prüft das Ergebnis und gegen welchen Datensatz?

Welche Informationen, Regeln, Werkzeuge und Messung [ein KI-System unternehmensspezifisch machen](/de/was-macht-ein-ki-system-fuer-ihr-unternehmen-spezifisch), erläutere ich separat.

## Modellnamen altern, Evaluierungsfragen bleiben


Ein Modellupdate kann Werkzeugnutzung, Anweisungsbefolgung, Kosten und Fehlerverhalten verändern. Ein Vergleich sollte deshalb neben dem Modellnamen Version, Datum und Betriebskonfiguration dokumentieren.

![Zwei versetzte Prüfplätze vergleichen Konfiguration und Fehlerprotokolle in einem gemeinsamen Messrahmen](/images/inline-model-application-harness/evaluation-record.webp)

## Ein stärkeres Modell kann ein fehlendes System nicht ersetzen

Ein fähigeres Modell kann komplexe Dokumente besser verstehen, mit weniger Anleitung das richtige Werkzeug wählen oder gleiche Qualität günstiger liefern. Die Modellwahl zählt weiter.

Ein stärkeres Modell kann aber kein Produkt reparieren, dem aktuelle Daten, softwareerzwungene Berechtigungen und eine Prüfung abgeschlossener Arbeit im führenden System fehlen. Eine gut gestaltete Anwendung kann umgekehrt einem ungeeigneten Modell keine unbegrenzte Fähigkeit geben. Sind die Schritte schon bekannt, kann ein [fester Arbeitsablauf verlässlicher und wirtschaftlicher als ein Agent](/de/wann-brauchen-sie-tatsaechlich-einen-ki-agenten){target="_blank" rel="noopener"} sein.

Bei der Bewertung eines KI-Produkts sollten Sie daher über seinen Modellnamen hinausgehen. Welcher Kontext, welche Werkzeuge, Berechtigungen und Betriebsstruktur erlauben ihm, Ihre Arbeit abzuschließen? Mit welchen Ergebnissen haben Sie diese Fähigkeit überprüft?

Die tatsächliche Fähigkeit eines Produkts erscheint nicht im Namen des Modells, sondern im Ergebnis, das das gesamte System in Ihrer Arbeit wiederholt erzeugen kann.

## Weiterführende Literatur

- [Codex as a platform](https://developers.openai.com/blog/codex-as-a-platform){.dofollow target="_blank" rel="noopener"}: Erläutert, wie Codex Kontext, Werkzeugnutzung, Freigaben und Fehlerwiederherstellung als Bestandteile seines Harness behandelt. Der Beitrag vertieft die technische Unterscheidung zwischen Modellfähigkeit und Produktfähigkeit.
- [Building effective agents](https://www.anthropic.com/engineering/building-effective-agents){.dofollow target="_blank" rel="noopener"}: Erörtert, wie Agentensysteme ein Modell durch Informationszugang, Werkzeuge und Gedächtnis erweitern. Der Text spiegelt den Produktansatz des Anbieters und sollte nicht als universelle Architekturregel gelesen werden.

---

Language: German
License: CC BY 4.0
License URL: https://creativecommons.org/licenses/by/4.0/
Scope: Evren Bal-authored text, unless this article expressly states otherwise.
Excluded: Third-party material, quoted excerpts, logos, and separately marked images retain their own rights.
Attribution: Credit Evren Bal, link to the canonical source and license, and indicate changes.
Source: https://evrenbal.com/de/warum-dasselbe-ki-modell-in-anwendungen-unterschiedliche-ergebnisse-liefert
