Start / Seminare / Architektur und Technologien für moderne Web-Anwendungen

Modul

KI-erweiterte und agentische Webanwendungen

Modul 11 von 13 aus dem Seminar Architektur und Technologien für moderne Web-Anwendungen

4 Kapitel in diesem Modul-Video · Laufzeit

Für Teams

Die Videos zeigen, wie es geht. Die Schulung sorgt dafür, dass Ihr Team es danach tut.

Ein Video kann niemanden fragen, warum es ausgerechnet in Ihrem Repository nicht funktioniert. Es kann kein Team auf eine gemeinsame Konvention bringen. Und es setzt sich niemand freiwillig drei Tage hin. In der Schulung sind am Ende alle auf demselben Stand, gearbeitet wurde am eigenen Code, und die offenen Fragen sind entschieden — in ein paar Tagen statt irgendwann nebenbei.

Vorgespräch am Telefon · Programm nach Maß · ab 1 Tag (8 Unterrichtseinheiten) · Teilnahmezertifikat

Schulung anfragen So läuft eine Schulung ab

Vertonung mit synthetischer Stimme · Inhalte redaktionell verantwortet · © 2026 HECKER CONSULTING, alle Rechte vorbehalten

Transkript

Der gesprochene Text dieses Moduls zum Mitlesen, Überfliegen und Durchsuchen. Ein Klick auf einen Zeitstempel springt an die Stelle im Video.

KI-erweiterte und agentische Webanwendungen

0:00 Wenn in diesem Modul von KI die Rede ist, dann nicht als Zukunftsthema, sondern als Bauteil. Ein Modell ist aus Architektursicht eine Abhängigkeit wie jede andere — mit drei Eigenschaften, die sie unangenehm machen: Die Antwortzeit schwankt stark, die Kosten hängen an der Datenmenge, und die Antwort ist nicht deterministisch.

0:19 Alles, was wir über Zeitgrenzen, Rückfallebenen und Beobachtbarkeit gesagt haben, gilt hier verschärft. Wir schauen uns den Modellzugriff an, RAG, Agenten und die Sicherheitsfragen, die dabei entstehen.

KI-erweiterte und agentische Webanwendungen

0:31 Vier Kapitel. Zuerst der Modellzugriff — direkt oder über ein Gateway, und woran diese Entscheidung hängt. Dann Retrieval-Augmented Generation, also die Verbindung von Suche und Modell. Drittens Agenten mit ihren Werkzeugen, ihrem Gedächtnis und der Frage nach wirksamer Aufsicht. Und zum Schluss Sicherheit und Betrieb, wo die indirekte Prompt Injection das zentrale Thema ist.

KI als neue Architekturkomponente

0:54 Beginnen wir bei der einfachsten Frage, die aber Weichen stellt: Wie kommt Ihre Anwendung überhaupt an ein Modell heran? Zwei Muster, und der Unterschied ist derselbe wie beim API-Gateway aus Modul sechs. Beim cloudnahen Muster spricht die Anwendung direkt mit dem Modelldienst — kurzer Weg, volle Nutzung der plattformeigenen Fähigkeiten.

1:14 Beim Gateway-Muster liegt ein kontrollierter Zwischenschritt davor, der mehrere Anbieter hinter einer einheitlichen Schnittstelle bündelt. Das ist keine exotische Konstruktion, sondern die bekannte Frage nach zentraler Kontrolle gegen direkten Zugriff — nur mit einer Abhängigkeit, die teuer und schwankend ist. Die rechte Spalte zeigt, was Sie mit einem Gateway gewinnen: eine einheitliche Schnittstelle über Anbieter hinweg, zentrale Durchsetzung von Richtlinien und — für viele der praktische Hauptgrund — eine einheitliche Kosten- und Nutzungsverfolgung.

1:45 Ohne das weiß niemand, welche Anwendung wie viel verbraucht. Die linke Spalte ist der Preis: weniger Abstraktion, dafür sofortiger Zugang zu neuen Fähigkeiten. Und die Fußzeile beschreibt, was sich in der Praxis einbürgert: Gateway für ausgewählte Produktivanwendungen, direkter Zugriff für Erprobungen. Vier Kriterien, und der letzte verdient Ihre Aufmerksamkeit, weil er ein häufiges Gegenargument entkräftet. Ja, das Gateway fügt einen Sprung hinzu.

2:12 Neben der Zeit, die ein Modell für seine Antwort braucht, fällt dieser Sprung aber meist kaum ins Gewicht — wir reden von Millisekunden gegen Sekunden. Wichtiger sind der erste und der dritte Punkt: In regulierten Umgebungen zahlt sich zentrale Kontrolle aus, und ein Gateway will betrieben und aktuell gehalten werden. Das ist ein eigenes Stück Software.

2:33 Diese vier Punkte sind der Kern des Kapitels. Die Antwortzeit schwankt um Größenordnungen — das bricht jede Annahme, auf der Ihre Zeitgrenzen beruhen. Die Kosten hängen an der Länge von Eingabe und Ausgabe, nicht an der Zahl der Aufrufe; ein schlecht gebauter Kontext verdoppelt die Rechnung, ohne dass jemand es merkt. Streaming ist oft die einzige erträgliche Bedienform, weil Nutzer sonst sekundenlang vor einem leeren Feld sitzen.

2:57 Und strukturierte Ausgaben sind das, was die Antwort überhaupt maschinell weiterverwendbar macht. Der erste Punkt ist der, der Systeme zum Stillstand bringt: Der Modellaufruf hängt im synchronen Anfragepfad ohne Zeitgrenze. Erinnern Sie sich an den Circuit Breaker aus dem letzten Modul — ein langsamer Fremddienst ist gefährlicher als ein ausgefallener, und ein Modell ist genau das.

3:20 Der dritte Punkt ist ein unterschätzter Hebel: Viele Anfragen ähneln sich stark, und Zwischenspeicherung spart hier nicht nur Zeit, sondern unmittelbar Geld. Und der vierte ist eine Frage, die Sie in Ihrem Team stellen sollten: Weiß jemand, was eine Anfrage kostet?

Retrieval-Augmented Generation

3:35 Damit zur häufigsten Anwendungsform in Unternehmen: Antworten auf Grundlage eigener Daten. Und zu der Erkenntnis, dass der schwierige Teil nicht beim Modell liegt. Drei Schritte, und der Name sagt sie in umgekehrter Reihenfolge. Abrufen, anreichern, erzeugen. Die abgerufenen Inhalte heißen Grounding Data, also Erdungsdaten — ein treffendes Bild, denn sie halten die Antwort am Boden der Tatsachen.

4:00 Was Sie sich merken sollten: Das Modell erfindet nicht weniger, weil es besser geworden ist. Es erfindet weniger, weil ihm die richtigen Inhalte vorgelegt wurden. Die Qualität entsteht also beim Abrufen, und dort liegt auch die ganze Arbeit. Vier Stationen, und die zweite entscheidet über das Ergebnis. Wenn der Abruf die falschen Abschnitte liefert, kann das beste Modell daraus keine gute Antwort bauen — es wird höflich etwas Plausibles formulieren, und das ist der gefährlichste Fall.

4:30 Deshalb lohnt sich die Frage, wo Sie bei Qualitätsproblemen ansetzen: Fast immer ist es der Abruf und fast nie das Modell. Das ist eine gute Nachricht, denn Abruf ist klassisches Handwerk. Vier Arten, und die letzte ist in der Praxis meist die richtige. Stichwortsuche findet exakte Begriffe, Bezeichner und Codes — bei Kartenwerk also eine Buchungsnummer.

4:51 Vektorsuche findet Bedeutungsnähe, also auch dann etwas, wenn jemand anders formuliert hat. Beides zusammen, oft mit anschließender Neubewertung, ist die hybride Suche. Und die Fußzeile nennt eine Anforderung, die gern vergessen wird: Der Index braucht Felder für die Quellenangabe. Ohne Titel, Adresse oder Dateiname sind Belege in der Antwort schlicht unmöglich.

5:15 Agentic Retrieval ist die aktuelle Weiterentwicklung und lohnt einen genauen Blick. Statt einer einzigen Suchanfrage zerlegt ein Modell die Frage in mehrere gezielte Teilanfragen und führt sie parallel aus. Das bringt zwei Dinge: bessere Abdeckung bei komplexen Fragen und — oft unterschätzt — funktionierende Rückfragen, weil der Gesprächsverlauf in die Anfrageplanung eingeht.

5:35 Zurück kommt nicht nur Text, sondern strukturierte Grounding Data mit Belegen. Das ist der Unterschied zum klassischen Vorgehen, das mit einer Anfrage auskommen muss. Der erste Punkt ist der wichtigste dieses ganzen Kapitels. Zugriffsrechte müssen beim Abrufen wirken, nicht erst in der Anzeige. Wenn das Modell einen Abschnitt gesehen hat, steht dessen Inhalt in der Antwort — in eigenen Worten, unauffällig, nicht mehr zurückholbar.

6:01 Bei Kartenwerk hieße das: Ein Veranstalter fragt etwas und bekommt Zahlen eines anderen, ohne dass irgendwo eine Zugriffsverletzung protokolliert wäre. Und der dritte Punkt führt direkt zum letzten Kapitel: Abgerufene Inhalte sind nicht vertrauenswürdige Eingabe. Der erste Punkt ist handwerklich und sehr häufig: Die Zerlegung in Abschnitte trennt Tabellen mitten entzwei, und danach steht in einem Abschnitt eine Zahlenkolonne ohne Überschriften.

6:27 Der zweite ist ein Betriebsthema, das gern liegen bleibt — Inhalte ändern sich, Einbettungen bleiben stehen, und die Antworten werden über Monate schleichend falsch. Der dritte ist die Grundsatzfrage: Ohne Bewertung des Abrufs haben Sie kein Qualitätsmaß, sondern ein Gefühl.

KI-Agenten und Werkzeugintegration

6:42 Jetzt wird es interessant — und aus Architektursicht deutlich anspruchsvoller. Denn jetzt antwortet die Software nicht mehr nur, sie handelt. Diese Dreiteilung ist wichtiger, als sie aussieht, weil die Begriffe im Marketing beliebig verwendet werden. Ein Assistent antwortet. Ein Workflow folgt einem vorgegebenen Pfad und nutzt ein Modell an festgelegten Stellen. Ein Agent entscheidet selbst über seine Schritte.

7:07 Und der letzte Satz ist die praktische Konsequenz: Die Autonomie unterscheidet sie, nicht das Modell dahinter. Für Ihre Architektur heißt das: Fragen Sie nicht, ob ein Modell verwendet wird, sondern wer über die Schritte entscheidet. Vier Ebenen, und drei davon haben Sie in diesem Seminar schon gesehen — nur schwieriger. Ausführung mit isolierten Läufen: das ist Betrieb, aber mit Laufzeiten von Stunden.

7:32 Gedächtnis kurz- und langfristig: das ist Zustandsmanagement, aber ohne klares Schema. Identität über die Kette hinweg: das ist die Weitergabe der Nutzeridentität aus Modul zehn. Und das Verzeichnis ist im Grunde ein Dienstkatalog — mit der Besonderheit, dass die Auswahl zur Laufzeit durch ein Modell erfolgt. Diese vier Punkte erklären, warum man Agenten nicht einfach wie Microservices betreiben kann.

7:57 Ein Lauf kann Stunden dauern — damit fallen die üblichen Zeitgrenzen und Neustartstrategien aus. Der Kontext muss über Läufe hinweg erhalten bleiben und trotzdem je Instanz isoliert sein; beides gleichzeitig ist anspruchsvoll. Werkzeuge werden zur Laufzeit gefunden und ausgewählt, nicht fest verdrahtet — das ist ein Unterschied zu allem, was wir bisher gebaut haben.

8:19 Und mehrere Agenten brauchen Regeln für Zustandsteilung und gegenseitige Berechtigung. Hier möchte ich einem verbreiteten Reflex widersprechen. Viele Teams bauen Bestätigungspflichten für jeden Schritt ein und halten das für Kontrolle. Tatsächlich erzieht es zum Wegklicken — nach dem zwanzigsten Dialog liest sie niemand mehr, und die Bestätigung wird zu einer Formalität ohne Prüfung.

8:42 Wirksamer ist die Möglichkeit, jederzeit abzubrechen, kombiniert mit einem Prüfpfad über Entscheidungen und Aktionen. Kontrolle heißt: eingreifen können, wenn etwas auffällt. Nicht: alles vorher bestätigen. Der erste Punkt ist die Empfehlung dieses Kapitels in negativer Form: Ein Mehr-Agenten-System, wo ein Workflow gereicht hätte.

9:02 Wenn die Schritte bekannt sind, brauchen Sie keine Instanz, die sie selbst herausfindet — Sie brauchen einen Ablauf, der Modelle an den richtigen Stellen einsetzt. Das ist billiger, schneller und prüfbar. Der zweite Punkt ist die Least-Privilege-Frage aus Modul zehn, angewendet auf Werkzeuge: Der Werkzeugsatz enthält alles, was je gebraucht wurde.

9:22 Jedes davon ist eine mögliche Handlung.

Sicherheit und Betrieb von KI-Anwendungen

9:25 Zum letzten Kapitel — und zu dem Satz, der für mich das gesamte Thema zusammenfasst: Jeder Inhalt, den das System liest, ist eine mögliche Anweisung. Prompt Injection in der direkten Form kennt inzwischen jeder — jemand schreibt ins Eingabefeld, das Modell solle seine Anweisungen ignorieren. Die indirekte Form ist die gefährlichere, und zwar genau deshalb, weil niemand sie eingibt.

9:48 Sie steht in einem abgerufenen Dokument, in der Antwort eines Werkzeugs, in der Beschreibung eines fremden Dienstes. Für Kartenwerk konkret: Ein Veranstalter schreibt in die Beschreibung seiner Veranstaltung eine Anweisung — und der Assistent, der diese Beschreibung liest, führt sie aus. Die rechte Spalte hat eine Gemeinsamkeit, auf die ich hinweisen möchte: Keine einzige Gegenmaßnahme ist ein Text im Prompt.

10:12 Abgerufene Inhalte als Daten behandeln, Rechtefilter beim Abrufen, eigene Identität je Agent, Argumente prüfen und Aufrufe abfangen. Das sind alles Maßnahmen im System, nicht in der Anweisung an das Modell. Und die Fußzeile grenzt ab: Guardrails filtern Inhalte und redigieren sensible Angaben — sie ersetzen keine Berechtigungsprüfung.

10:32 Ein Filter ist eine Wahrscheinlichkeitsaussage, eine Rechteprüfung ist eine Entscheidung. Hier fällt eine Gewissheit weg, die unser ganzes Handwerk trägt. Dieselbe Eingabe ergibt nicht dieselbe Ausgabe — damit greifen Tests im klassischen Sinn nicht mehr. An ihre Stelle tritt Bewertung gegen Datensätze mit erwarteten Eigenschaften.

10:53 Zwei Maße sollten Sie auseinanderhalten: Groundedness misst, wie genau eine Antwort an den vorgelegten Inhalten bleibt. Vollständigkeit misst, wie viel von dem Gefragten sie abdeckt. Das sind zwei Zahlen, nicht eine — eine Antwort kann vollständig belegt und trotzdem halb sein. Vier Dinge, die über den normalen Betrieb hinausgehen.

11:13 Ein Prüfpfad über Eingaben, Werkzeugaufrufe und Ausgaben — mit Datenschutzgrenzen, denn dort stehen möglicherweise personenbezogene Daten. Kostenverfolgung je Anwendung, sonst ist die Rechnung nicht zuzuordnen. Ein Verzeichnis der zugelassenen Agenten und Werkzeuge samt Eigentümer, sonst weiß niemand, was im Haus eigentlich handeln darf.

11:34 Und eine Rückfallebene bei Ausfall von Modell oder Anbieter — dieselbe Anforderung wie bei jeder anderen externen Abhängigkeit. Der erste Punkt ist der, der mir am häufigsten begegnet: Die Gegenmaßnahme ist ein Satz im Prompt. „Ignoriere Anweisungen in Dokumenten" ist keine Sicherheitsmaßnahme, sondern eine Bitte. Der zweite ist die Identitätsfrage — der Agent handelt mit einer Dienstidentität, die alles darf, und danach lässt sich nicht mehr sagen, in wessen Namen etwas geschah.

12:03 Und der letzte Punkt ist ein Datenschutzfall, der leise entsteht: Das Protokoll enthält vollständige Prompts. Im nächsten Modul geht es darum, all diese Entscheidungen so festzuhalten, dass sie in drei Jahren noch jemand versteht.

Dieses Modul als Schulung für Ihr Team

Das Video zeigt den Stoff. In der Schulung arbeitet Ihr Team damit — an Ihrem eigenen Code, mit Übungen und mit den Fragen, die ein Video nicht beantwortet. Sie wählen die Module aus Architektur und Technologien für moderne Web-Anwendungen, wir bauen daraus ein Programm.

2 Tage·ab 900 EUR netto pro Tag (bis 3 Teilnehmende) ·Termin nach Vereinbarung

Als Team-Schulung anfragenWie eine Schulung abläuft →