Im Auftrag der Infrastruktur: Wie Multi-Agenten-Systeme den IT-Betrieb beherrschbar machen
Monolithische IT-Infrastrukturen waren gestern. Mit der wachsenden Komplexität stoßen klassische Betriebsmodelle im IT-Betrieb an ihre Grenzen.
GastkommentarOliver Köth, Managing Director Technology and Innovation DACH bei NTT DATA · Frank Beckereit, Senior Director Consulting bei NTT DATA
Monolithische IT-Infrastrukturen waren gestern, heute prägen vernetzte Anwendungen, Cloud-Dienste und Plattformen den IT-Betrieb. Mit der wachsenden Komplexität stoßen klassische Betriebsmodelle allerdings zunehmend an ihre Grenzen. Die gute Nachricht: Es gibt mit Multi-Agenten-Systemen bereits Lösungen, die ganze IT-Prozessketten gezielt automatisieren und den Menschen dabei unterstützen, Zusammenhänge und Ursachen schneller zu erkennen.
Das Wichtigste in Kürze
- Spezialisierte Agenten statt einer Instanz. Logs, Metriken, Konfigurationszustände und Alarme bewerten getrennte Agenten. Eine Orchestrierungsschicht entscheidet, wer wann eingebunden wird.
- Der Engpass ist die Korrelation. Die automatisierte Klassifizierung von Betriebsdaten ist etabliert. Das systemübergreifende Verknüpfen bleibt der offene Schritt.
- Einführung in Stufen. Zuerst analysieren und priorisieren, danach risikoarme Operationen automatisiert ausführen. Governance-Regeln legen fest, wo an Menschen eskaliert wird.
Der eigentliche Auslöser wirkt oft unspektakulär: Ein Alarm aus dem Netzwerk, eine auffällige Antwortzeit einer Anwendung oder ein ausgefallener Dienst. Was daraufhin allerdings in vielen IT-Abteilungen folgt, ist häufig eine aufwendige Suche nach der Nadel im Heuhaufen, nämlich der eigentlichen Ursache. Liegt das Problem im Netzwerk? An einer API? Im Rechenzentrum? Oder doch bei einem Cloud-Service? Mit jeder zusätzlichen Anwendung, jeder neuen Schnittstelle und jedem ausgelagerten Dienst wachsen die Abhängigkeiten zwischen den einzelnen Komponenten. Ursache und Auswirkung liegen deshalb immer seltener am selben Ort.
Klassische Monitoring- und Betriebswerkzeuge erfassen dabei zwar zuverlässig den Zustand einzelner Systeme, stoßen bei der Einordnung solcher Zusammenhänge und deren Auswirkungen auf das operative Geschäft jedoch zunehmend an Grenzen. Der Grund dafür ist weniger die Komplexität moderner IT-Landschaften als vielmehr die seit Jahren stetig wachsende Menge an Log- und Betriebsdaten. Erst wenn diese Informationen klassifiziert und systemübergreifend miteinander korreliert werden, lassen sich Zusammenhänge und Ursachen zuverlässig erkennen. Wo die automatisierte Klassifizierung heute weitgehend etabliert ist, bildet die intelligente Korrelation mithilfe von KI den nächsten Evolutionsschritt. Wie funktioniert das?
Anders als klassische Ansätze setzen Multi-Agenten-Systeme auf mehrere spezialisierte Agenten, die unterschiedliche Aufgaben übernehmen und ihre Erkenntnisse miteinander teilen. Während einzelne Agenten beispielsweise Logs analysieren, Metriken auswerten oder Netzwerkereignisse bewerten, führen andere diese Informationen zusammen und stellen sie in einen gemeinsamen Kontext. So entsteht schrittweise ein Gesamtbild, das Zusammenhänge zwischen verteilten Systemen sichtbar macht und IT-Teams dabei unterstützt, Ursachen und Auswirkungen von Störungen deutlich schneller zu erkennen.
Neue Architekturen braucht das Land
Multi-Agenten-Systeme modellieren den IT-Betrieb als verteiltes Verarbeitungssystem. Statt eine zentrale Instanz mit der Analyse aller Daten zu betrauen, werden Aufgaben in spezialisierte Agenten zerlegt, die jeweils auf klar abgegrenzte Funktionsbereiche ausgerichtet sind. Diese Agenten arbeiten kontinuierlich im Hintergrund. Anfallende Ereignisdaten ordnen sie dabei immer in den laufenden Systemkontext ein.
Typische Spezialisierungen umfassen dabei etwa die Analyse von Logdaten, die Bewertung von Konfigurations- und Gerätezuständen, die Klassifikation von Alarmen oder die Korrelation von Ereignissen über mehrere Systeme hinweg. Andere Agenten übernehmen Aufgaben wie historische Muster in Betriebsdaten zu erkennen oder wiederkehrende Fehlerbilder zu identifizieren. Der große Vorteil gegenüber herkömmlichen Architekturansätzen liegt in der automatisierten, orchestrierten Zusammenarbeit der Funktionseinheiten.
Eine Stufe darüber koordiniert eine zentrale Orchestrierungsschicht die Aktivierung und Interaktion der Agenten. Sie bestimmt, welche Agenten in welcher Situation eingebunden werden, wie Ergebnisse zusammengeführt und in welchem Kontext Entscheidungen vorbereitet werden. Ergänzt wird diese Struktur durch eine Governance-Logik, die den Handlungsspielraum der Agenten definiert. Diese Regeln legen fest, welcher Agent welche Aktionen automatisiert ausführen darf und wann eine Eskalation an menschliche Verantwortliche erforderlich ist. Dadurch entsteht ein System, das operative Aufgaben effizient verteilt und die menschliche Kontrolle über kritische Entscheidungen behält.
Schrittweise Transformation

Die Einführung agentischer Systeme erfolgt im IT-Betrieb in der Regel schrittweise und baut auf bestehenden Automatisierungs- und Monitoringstrukturen auf. Auf der ersten Stufe übernehmen Agenten unterstützende Funktionen, indem sie Daten analysieren, Alerts priorisieren und kontextualisierte Informationen bereitstellen, während die eigentliche Entscheidung weiterhin beim menschlichen Betriebsteam liegt. Der Mehrwert entsteht hier vor allem in der Vorverarbeitung großer Datenmengen und der starken Reduktion des ansonsten immer lauteren Informationsrauschens.
In der nächsten Entwicklungsstufe können Agenten klar definierte, risikoarme Operationen automatisiert ausführen. Dazu zählen etwa standardisierte Reaktionen auf bekannte Fehlerszenarien oder wiederkehrende Konfigurationsprobleme. Diese Eingriffe erfolgen innerhalb definierter Grenzen und werden systematisch protokolliert, sodass ihre Auswirkungen nachvollziehbar bleiben und in zukünftige Entscheidungen einfließen können. Die Systeme bewegen sich damit bereits in Richtung aktiver Betriebsunterstützung, bleiben aber immer unter der vollen Kontrolle.
In der nächsten Evolutionsstufe kann auf dieser Basis ein Betriebsmodell entstehen, in dem Agentensysteme über kleinere Szenarien hinauswachsen. Sie stellen dann auch im großen Umfang aktiv Zusammenhänge zwischen Ereignissen her und leiten daraus automatisiert konkrete Maßnahmen ab. Dafür werden mehrere Agenten eingebunden, um Ursachen zu analysieren, Hypothesen zu bewerten und mögliche Handlungsoptionen zu priorisieren. Die Entscheidungsfindung erfolgt weiterhin innerhalb definierter Governance-Regeln, die sicherstellen, dass kritische Eingriffe nachvollziehbar bleiben und bei Bedarf eskaliert werden können.
Strukturelle Auswirkungen auf den IT-Betrieb
Mit der Einführung von Agenten-basierten Architekturen verändert sich die operative Realität im IT-Betrieb grundlegend. Große Mengen an Events werden bereits in frühen Phasen der Verarbeitung gefiltert, korreliert und bewertet, sodass nur noch ein deutlich reduzierter Anteil als tatsächlich relevante Incidents in den operativen Betrieb gelangt. Dadurch verschiebt sich der Schwerpunkt der Arbeit von der Bearbeitung einzelner Meldungen hin zur Interpretation systemischer Zusammenhänge.
Eine Entwicklung, die sich auch auf die Rollenverteilung innerhalb von IT-Organisationen auswirkt. Während repetitive, leicht automatisierbare operative Tätigkeiten von Agenten übernommen werden, rücken Aufgaben wie die Definition von Automatisierungsregeln, die Überwachung von Agentensystemen, die Bewertung relevanter Events und die kontinuierliche Weiterentwicklung von Betriebslogiken stärker in den Vordergrund. Der IT-Betrieb wird damit ein Stück mehr zu einer Steuerungsfunktion verteilter Systeme. Im Fokus steht dann die Stabilität und Effizienz des Gesamtsystems statt des einzelnen Tickets.
All das entlastet nicht nur die IT-Teams, es entsteht auch eine neue Qualität der Betriebssteuerung. Durch die kontinuierliche Korrelation von Ereignissen über Systemgrenzen hinweg können Muster schneller – oder erst überhaupt – erkannt werden, die in klassischen Monitoring-Architekturen häufig verborgen bleiben. Das betrifft insbesondere komplexe Fehlerketten, die sich über mehrere Systeme hinweg entfalten und erst in ihrer Gesamtheit erklärbar sind. Mit dieser Entwicklung verschwimmen auch die Grenzen zwischen Monitoring, Analyse und operativer Ausführung. IT-Infrastrukturen entwickeln sich zu kontinuierlich arbeitenden Systemen, die Zustände beobachten, aktiv interpretieren und innerhalb definierter Rahmenbedingungen beeinflussen. Der Fokus verlagert sich damit von der reinen Reaktion auf Ereignisse hin zur strukturierten Steuerung komplexer Systemzustände.
Oliver Köth ist Managing Director Technology and Innovation DACH bei NTT DATA.
Frank Beckereit ist Senior Director Consulting bei NTT DATA.
Häufige Fragen
Was unterscheidet Multi-Agenten-Systeme von klassischem Monitoring?
Klassische Werkzeuge erfassen den Zustand einzelner Systeme zuverlässig. Multi-Agenten-Systeme verteilen die Analyse auf spezialisierte Agenten, die ihre Erkenntnisse zusammenführen und in einen gemeinsamen Kontext stellen.
Wo liegt der eigentliche Engpass im IT-Betrieb?
Die automatisierte Klassifizierung von Betriebsdaten ist heute weitgehend etabliert. Offen bleibt die systemübergreifende Korrelation, die Zusammenhänge zwischen verteilten Systemen sichtbar macht.
Wie führen Unternehmen solche Systeme ein?
In Stufen. Zuerst analysieren Agenten Daten und priorisieren Alerts, die Entscheidung bleibt beim Betriebsteam. Danach führen sie klar definierte, risikoarme Operationen automatisiert aus.
Wer behält die Kontrolle über kritische Eingriffe?
Eine Governance-Logik legt fest, welcher Agent welche Aktionen ausführen darf und wann an menschliche Verantwortliche eskaliert wird. Eingriffe werden protokolliert und bleiben nachvollziehbar.
Lesetipps der Redaktion
cloudmagazinObservability frisst das Cloud-Budget unbemerktcloudmagazinWenn KI-Agenten reisen: Data-Residency als Operating-ProblemcloudmagazinObservability: Mehr als Monitoring mit Logs und MetrikenBildquelle: KI-generiert (August 2026), Innenbild GettyImages/NTT DATA

