Was ein „Hallo“ kostet: KI-Nutzung im Unternehmen steuern
Von Evren BalVeröffentlicht · 6 Min. Lesezeit

Seite kopieren
Ich schreibe diesen Beitrag nicht als jemand, der die KI-Nutzung in einer Organisation mit Tausenden Beschäftigten gesteuert hat. Das Unternehmen, in dem ich arbeite, liegt eher bei dem unten beschriebenen kleinen Team. Von Freunden, die in großen Organisationen arbeiten, habe ich jedoch direkte Beobachtungen darüber gehört, wie Nutzung und Kosten in dieser Größenordnung behandelt werden. Der Beitrag baut auf dieser Unterscheidung zwischen zwei Blickwinkeln auf.
Die Kosten von KI-Werkzeugen für zwei oder drei Entwicklerinnen und Entwickler sowie acht oder zehn Büroangestellte zu verfolgen, ist etwas anderes als die KI-Nutzung von Tausenden Menschen zu steuern. Im ersten Fall lassen sich einige Abonnements, Nutzungsgrenzen und die entstehende Arbeit meist überblicken. Im zweiten Fall verbergen sich hinter derselben Oberfläche viele Arbeitsabläufe, unterschiedliche Datenregeln und eine wachsende Verbrauchsrechnung.
Das erklärt, warum große Unternehmen ihre Nutzerinnen und Nutzer manchmal bitten, selbst einzelne Wörter einzusparen. Eine Gewohnheit, die bei einem persönlichen Abonnement kaum ins Gewicht fällt, kann im gemeinsamen Budget zu einem Aufwand werden, der aktiv gesteuert werden muss.
Ein Bericht von 404 Media vom Juli 2026 beschreibt auf Grundlage interner Nachrichten und Dokumente, wie große Unternehmen die KI-Nutzung wegen steigender Kosten einschränken. Zu den berichteten Maßnahmen zählt, Beschäftigte auf weniger leistungsfähige Modelle zu verweisen. Der Bericht schildert Praktiken einzelner Unternehmen. Interessant ist darüber hinaus, wie Ausgaben, die in einem kleinen Team beherrschbar wirken, mit wachsender Nutzung zu einer anderen Managementaufgabe werden.
Mit der Größe ändert sich nicht nur die Zahl der Nutzenden
In einem kleinen Team, in dem die meisten Beschäftigten KI über eine Chatoberfläche nutzen und nur wenige mit Agenten arbeiten, lassen sich Ausgaben vergleichsweise leicht verfolgen. Sie kennen vielleicht nicht jeden Prompt oder jede Arbeitsmethode. In der Regel sehen Sie aber, wer Zugang zu welchem Werkzeug hat und welche monatlichen Kosten entstehen.
Das bedeutet nicht, dass ein kleines Team keine hohe Rechnung verursachen kann. Auch einige wenige Menschen können durch intensive Agentennutzung hohe Kosten erzeugen. Bei einer begrenzten Zahl von Nutzenden ist es jedoch leichter, die Gründe für steigenden Verbrauch zu besprechen und die Arbeitsweise anzupassen.
In einem großen Unternehmen kommen weitere Entscheidungen hinzu. Es muss festlegen, welche Daten an welchen Anbieter übermittelt werden dürfen, wer welche Modelle nutzen kann und wie die Nutzung dokumentiert wird. Sicherheits-, Datenschutz- und regulatorische Pflichten können den Wechsel zu einem günstigeren Dienst ebenfalls begrenzen. Für bestimmte Aufgaben kommen bestimmte Anbieter in Frage oder Open-Weight-Modelle, die im eigenen Umfeld betrieben werden können.
Auch die Abrechnung hat nicht nur eine Form. Gebühren pro Nutzer, im Paket enthaltene Nutzung und verbrauchsabhängige Mehrkosten können Teil derselben Unternehmensvereinbarung sein. Bei tokenbasierter Abrechnung geht der Text, den ein Modell liest und erzeugt, in die Rechnung ein. Es reicht deshalb nicht, nur die Zahl der Konten zu zählen.
Agenten verändern diese Rechnung zusätzlich. Ein Nutzer kann nur eine Aufgabe vergeben. Der Agent kann aber Dokumente prüfen und mehrere Modellaufrufe ausführen, um sie zu erledigen. Eine Anfrage auf dem Bildschirm muss im Hintergrund nicht einer einzigen Operation entsprechen.

Was hinter der Aufforderung steckt, nicht Hallo zu sagen
Von Freunden, die in einigen großen Banken und Holdings in der Türkei arbeiten, habe ich gehört, dass Beschäftigte darauf hingewiesen werden, ein KI-System nicht zu begrüßen oder ihm zu danken. Das sind keine offiziellen Richtlinien, sondern Beispiele aus Gesprächen mit Freunden.
Die Kostenüberlegung hinter einer solchen Aufforderung kann ich nachvollziehen. Nutzerinnen und Nutzer müssen wissen, dass Verbrauch Geld kostet. Dieselbe Anfrage unnötig zu wiederholen, lange Antworten zu erzeugen, obwohl sie nicht gebraucht werden, oder einen Agenten erfolglose Versuche fortsetzen zu lassen, kann die Ausgaben erhöhen.
Wer sinnvoll sparen will, muss jedoch auf die tatsächliche Nutzung schauen. Eine kurze Dankesnachricht und ein langes Dokument, das bei jedem Schritt erneut gelesen wird, sind nicht zwingend Kosten derselben Größenordnung. Den Beschäftigten nur zu sagen, sie sollten kürzer schreiben, macht solche Wiederholungen im System dahinter nicht sichtbar.
Ein separater Bericht von 404 Media beschreibt, dass in einer internen Diskussion bei Accenture nicht Ingenieurinnen und Ingenieure mit großen Mengen erzeugten Codes, sondern technische Fachfremde als wichtige Ursache des Verbrauchs genannt wurden, etwa beim Umwandeln von PDFs in Präsentationen. Das spricht dafür, den hohen Verbrauch nicht nur über Entwicklerwerkzeuge zu beobachten; die Aussage beruht jedoch auf durchgesickertem internen Material und lässt sich nicht auf die gesamte Branche übertragen.
Ein gut gestaltetes System kann einen Teil der Einsparung selbst übernehmen
Unternehmen haben Möglichkeiten, diese Kosten zu senken. Häufig wiederkehrende Anweisungen und Dokumente können aus einem Cache bereitgestellt werden. Das senkt die Kosten, denselben Inhalt erneut zu verarbeiten. Lange Gespräche lassen sich so zusammenfassen, dass die für spätere Schritte nötigen Informationen erhalten bleiben; dadurch verringert sich die übertragene Textmenge. Anthropic behandelt beide Ansätze zusammen mit Nutzergewohnheiten im Leitfaden zur Kostensteuerung in Claude Code. Caching lässt die Rechnung nicht verschwinden, und beim Zusammenfassen müssen die für den nächsten Schritt wichtigen Einzelheiten erhalten bleiben.
Eine weitere Möglichkeit ist, eine Aufgabe an ein dafür geeignetes Modell zu leiten. Ein Modell, das für eine einfache Klassifikation ausreicht, muss nicht für eine komplexe Bewertung genügen. In meinem Artikel über die Vereinbarung zwischen Stripe und OpenRouter habe ich denselben Punkt behandelt: Modellpreis und Gesamtkosten der Arbeit müssen zusammen betrachtet werden. Führt ein günstigeres Modell zu mehr Korrekturen, wird ein Teil der scheinbaren Einsparung durch Arbeitszeit der Beschäftigten bezahlt.
Auch die Länge einer Antwort lässt sich an die Aufgabe anpassen. Wenn ein Prozess nur einige Felder füllen muss, braucht er möglicherweise keine seitenlange Erklärung. Arbeit, deren Ergebnis nicht sofort vorliegen muss, kann für einen günstigeren Batch-Verarbeitungsdienst eines Anbieters geeignet sein. Der Preis dafür ist ein späteres Ergebnis. Verfügbarkeit und Preise hängen vom gewählten Dienst ab.
All das nimmt die Nutzerinnen und Nutzer nicht vollständig aus der Gleichung. Sie müssen weiter klar beschreiben, was sie brauchen, irrelevante Dateien nicht anhängen und erkennen, wenn ein Agent vom Ziel der Aufgabe abweicht. Bei häufig wiederkehrender Arbeit ist es jedoch sinnvoller, dass das System einen Teil dieser Entscheidungen übernimmt, statt von jeder Person Token-Buchhaltung zu erwarten.

Das Budget muss zusammen mit der erledigten Arbeit gelesen werden
Nutzungsgrenzen können nötig sein, besonders wenn der Verbrauch rasch wächst. Allen dieselbe Grenze zu geben bedeutet jedoch, unterschiedliche Arbeit zu behandeln, als hätte sie dieselben Voraussetzungen. Wer kurze Texte vorbereitet, benötigt möglicherweise nicht dieselbe Nutzung wie jemand, der lange Dokumente vergleicht.
Deshalb ist auch hier der erste Schritt sinnvoll, den ich für ein Inventar der KI-Nutzung vorgeschlagen habe: zunächst herausfinden, was Menschen tatsächlich tun. Dann lässt sich prüfen, ob hohe Ausgaben aus einer großen Menge erledigter Arbeit, aus unnötigen Wiederholungen oder aus einer falschen Modellauswahl entstehen. Arbeitstypen, Nutzungsumfang und akzeptierte Ergebnisse lassen sich gemeinsam betrachten, ohne jedes Gespräch von Beschäftigten zu lesen.
Würde ich dies in einem großen Unternehmen steuern, würde ich zuerst die wenigen Arbeitsabläufe mit dem höchsten Verbrauch prüfen. Ich würde unnötige Wiederholungen reduzieren, testen, welches Modell ausreicht, und das Budget zusammen mit der erledigten Arbeit bewerten. Außerdem würde ich erklären, warum ein bestimmtes Verhalten Kosten erzeugt. Wenn ein Limit erreicht ist, bestünde die Entscheidung dann nicht nur darin, den Zugang abzuschalten. Das Unternehmen wüsste auch, welche Arbeit es anhält und was es kostet, wenn diese Arbeit warten muss.
Wenn dieser Artikel hilfreich war
Ein Link von einer passenden Seite Ihrer Website oder das Teilen in sozialen Medien hilft diesem Artikel, mehr Menschen zu erreichen. Vielen Dank.
Hinweise zu Links und Marke →Über diesen Artikel
Dieser Beitrag wurde auf Grundlage der englischen Fassung redaktionell für die deutsche Ausgabe lokalisiert.
- Einsatz künstlicher Intelligenz
- Mit KI-Unterstützung — Evren Bal hat die zentrale Idee, die Einordnung nach Größenordnung und die von Freunden geschilderten Beispiele eingebracht. KI unterstützte bei der Quellenprüfung und der Struktur des Entwurfs.
