Lange Zeit stand beim Aufbau von KI-Lösungen weltweit vor allem das Training grosser Modelle im Vordergrund. Mit der zunehmenden Integration von KI in Prozesse, Anwendungen und Kundeninteraktionen verschiebt sich der Schwerpunkt jedoch: Inference (das produktive Ausführen von Modellen für konkrete Anfragen) wird zur dauerhaften Betriebsaufgabe.
Die Entwicklung ist nachvollziehbar. Ein Modell einmal zu trainieren, ist ein Projekt. Es dauerhaft für Mitarbeitende, Kunden oder automatisierte Prozesse verfügbar zu machen, ist eine Betriebsaufgabe. Sie wächst mit jeder Anfrage, jedem angebundenen System und jedem zusätzlichen Use Case.
Besonders sichtbar wird dies bei agentischen KI-Anwendungen. Anders als ein einfacher Chatbot bearbeiten sie mehrere Arbeitsschritte, greifen auf Informationen zu und prüfen Zwischenergebnisse. Damit steigen sowohl die Zahl der Modellaufrufe als auch die damit verbundenen Kosten. Günstigere Modelle oder Tokens allein lösen diese Herausforderung nicht. Neben Caching- oder GPU-Runtime-Optimierung ist entscheidend, welche Aufgabe welches Modell tatsächlich benötigt.