Aktuelle Einordnung
Die Token-Rechnung vieler KI-Agenten geht nicht auf
Was passiert. Agentische Systeme verbrauchen pro Aufgabe ein Vielfaches der Token, die ein Chat-Assistent benötigt: Sie planen, prüfen und wiederholen. Bei vielen Anwendungen steigen die Inferenzkosten schneller als der Nutzen.
Für Deutschland. Sinkende Preise pro Token lösen das Problem nicht, wenn der Verbrauch pro Aufgabe schneller steigt. Für klar umrissene Routineaufgaben werden kleinere, lokal betriebene Modelle attraktiv: berechenbare Kosten, Daten im Haus, geringere Abhängigkeit von einzelnen Anbietern.
Was jetzt. Pro Anwendungsfall die Kosten je erledigter Aufgabe messen, nicht den Preis pro Token. Und früh testen, welche Aufgaben ein kleines lokales Modell genauso gut erledigt.