KI wirtschaftlich skalieren ist eine Frage der Architektur

Trends & InventxLab
Vier Personen im Besprechungsraum, diskutieren am Tisch vor großen Monitoren.
KI wirtschaftlich zu skalieren, ist nicht nur eine Modellfrage, sondern auch eine Frage der Architektur. Entscheidend ist, wie Banken und Versicherungen GPU-Runtime, Inference-Kapazität, Caching, Guardrails und die Auswahl der passenden Modelle aufeinander abstimmen und optimieren. Erst das effiziente Zusammenspiel schafft die Grundlage, KI-Use-Cases wirtschaftlich zu betreiben und sensible Informationen zu schützen.

Inference wird zur Betriebs- und Kostenfrage

Lange Zeit stand beim Aufbau von KI-Lösungen weltweit vor allem das Training grosser Modelle im Vordergrund. Mit der zunehmenden Integration von KI in Prozesse, Anwendungen und Kundeninteraktionen verschiebt sich der Schwerpunkt jedoch: Inference (das produktive Ausführen von Modellen für konkrete Anfragen) wird zur dauerhaften Betriebsaufgabe.

Die Entwicklung ist nachvollziehbar. Ein Modell einmal zu trainieren, ist ein Projekt. Es dauerhaft für Mitarbeitende, Kunden oder automatisierte Prozesse verfügbar zu machen, ist eine Betriebsaufgabe. Sie wächst mit jeder Anfrage, jedem angebundenen System und jedem zusätzlichen Use Case. 
Besonders sichtbar wird dies bei agentischen KI-Anwendungen. Anders als ein einfacher Chatbot bearbeiten sie mehrere Arbeitsschritte, greifen auf Informationen zu und prüfen Zwischenergebnisse. Damit steigen sowohl die Zahl der Modellaufrufe als auch die damit verbundenen Kosten. Günstigere Modelle oder Tokens allein lösen diese Herausforderung nicht. Neben Caching- oder GPU-Runtime-Optimierung ist entscheidend, welche Aufgabe welches Modell tatsächlich benötigt. 
 

Gartner erwartet für 2026 weltweit Ausgaben von 42 Milliarden US-Dollar für Infrastrukturservices für KI-Workloads. Rund 55 Prozent davon sollen auf Inference entfallen.
Quelle: Gartner Forecasts

Nicht jede Anfrage braucht das grösste Modell

Mit zunehmender Nutzung wird es ineffizient, jede Anfrage standardmässig an das leistungsfähigste und rechenintensivste Modell zu senden. Für viele Aufgaben reicht ein kleineres oder spezialisiertes Modell. Andere benötigen besondere Fähigkeiten, hohe Performance oder eine Umgebung mit klaren Anforderungen an Datenschutz, Governance und Souveränität. 

Hier setzt intelligentes Routing an. Es verbindet Anforderungen an Modellgrösse, Spezialisierung, Kosten sowie Datenhaltung und Compliance. Die richtige Anfrage wird an das passende Modell und in die passende Umgebung geleitet. 

Guardrails definieren dabei, was zulässig ist und was nicht. Sie legen beispielsweise fest, welche Daten in welcher Umgebung verarbeitet werden dürfen. Der Ausbau zu einer intelligenten Steuerung ermöglicht es, für eine bestimmte Anfrage das effizienteste Modell zu verwenden. So wird aus einer einfachen Auswahlregel eine gesteuerte Architektur: Nicht jede Aufgabe braucht dieselbe Infrastruktur, und nicht jede Information darf eine Umgebung verlassen. 

Hybride Architektur verbindet Innovation, Wirtschaftlichkeit und Kontrolle

Für Finanzinstitute ist diese Steuerung besonders relevant. Sie müssen Innovation und Geschwindigkeit ermöglichen sowie die Kosten kontrollieren, ohne die Souveränität dem Komfort zu opfern. Eine hybride KI-Architektur verbindet diese Anforderungen: Sie nutzt Public-Cloud-Modelle dort, wo dies fachlich und wirtschaftlich sinnvoll ist, und hält sensitive Daten sowie kritische Workloads in einer kontrollierten Umgebung. 

Inventx stellt mit Model as a Service Modelle aus der ix.Cloud bereit. Die ix.Cloud ist die Inventx Community-Cloud-Lösung und eine private Cloud in eigenen Rechenzentren. Im Sommer 2026 hat Inventx in den Ausbau der GPU-Infrastruktur investiert, um zusätzliche Kapazitäten für Inference-Leistungen bereitzustellen. 

Neu bietet Inventx auch das Modellmanagement als Service an, mit Routing basierend auf individuellen Guardrails. Dabei lässt sich beispielsweise steuern, dass Anfragen mit sensitiven Daten ausschliesslich an ein Modell in der ix.Cloud geleitet werden. Der nächste Schritt ist eine intelligente Steuerung, die nicht nur eine manuelle Modellwahl ermöglicht, sondern pro Anfrage das passende Modell bestimmt. 

Wer KI produktiv skalieren will, sollte deshalb nicht nur fragen: Welches Modell ist am leistungsfähigsten? Wichtiger ist: Welche Architektur macht den Einsatz für diesen Use Case wirtschaftlich, kontrollierbar und betreibbar? 

Author

Carla Caspar

Product Managerin Data Platform & AI Services

LinkedIn
Foto Carla Caspar