Alle Artikel
6 Min. Lesezeit

KI in Web-Anwendungen: Die häufigsten Fehler bei der Integration

Eine KI-Funktion kann in der Demo überzeugen und im Alltag Probleme verursachen. Diese Integrationsfehler führen zu falschen Ergebnissen, ungewollten Zugriffen und zusätzlicher Arbeit.

KI in Web-Anwendungen: Die häufigsten Fehler bei der Integration

Eine Kundenanfrage wird automatisch zusammengefasst. Ein Dokument liefert die Daten für ein Formular. Mitarbeiter stellen Fragen zu internen Unterlagen und erhalten passende Antworten. Solche Funktionen können Arbeit abnehmen.

In einer ersten Demo lässt sich das oft schnell zeigen. Im Alltag kommen unvollständige Angaben, widersprüchliche Dokumente und Nutzer mit unterschiedlichen Zugriffsrechten dazu. Dann zeigt sich, ob die Funktion zuverlässig in die Anwendung eingebaut wurde.

Zur Integration gehört der gesamte Ablauf von der Eingabe bis zur Verwendung des Ergebnisses. Ein Modell anzubinden und seine Antwort anzuzeigen deckt davon nur einen Teil ab.

1. Die Aufgabe bleibt zu ungenau

Ein Assistent soll Kundenanfragen bearbeiten. Diese Beschreibung lässt offen, ob er Informationen zusammenfasst, Rückfragen formuliert oder selbst eine Antwort verschickt. Jede dieser Aufgaben braucht andere Daten und Prüfungen.

Für einen ersten Umfang würde ich die Aufgabe enger beschreiben. Zum Beispiel: Aus einer Anfrage werden das Anliegen, eine genannte Auftragsnummer und fehlende Angaben ermittelt. Dein Team prüft das Ergebnis, bevor es weiterverwendet wird.

Vor der Umsetzung sollten vier Punkte feststehen:

  • Eingabe: Welche Texte, Dateien oder Daten erhält die Funktion?
  • Ergebnis: Was soll sie konkret zurückgeben?
  • Prüfung: Woran lässt sich erkennen, ob das Ergebnis brauchbar ist?
  • Folgeschritt: Wer verwendet es und was passiert damit?

Damit kannst du auch den Nutzen prüfen. Wenn Mitarbeiter jede Zusammenfassung vollständig neu schreiben müssen, bleibt wenig Zeitersparnis übrig.

2. Das Modell bekommt ungeeignete Informationen

Ein Assistent soll Fragen zu deinem Angebot beantworten, erhält aber nur eine allgemeine Beschreibung des Unternehmens. Aktuelle Leistungen, Bedingungen und Ausnahmen fehlen. Trotzdem kann er eine Antwort formulieren, die überzeugend klingt.

Für Antworten aus eigenen Dokumenten wird häufig zuerst nach passenden Textstellen gesucht. Diese werden dem Modell zusammen mit der Frage übergeben. Dieses Verfahren wird als RAG bezeichnet, kurz für Retrieval-Augmented Generation.

Auch dabei kann der Fehler schon vor der eigentlichen Antwort entstehen. Die Suche findet eine alte Preisübersicht, übersieht eine wichtige Fußnote oder liefert Unterlagen zu einem anderen Produkt.

Deshalb müssen die Dokumente und die Suche mitgeprüft werden. Welche Fassung gilt? Bleiben zusammengehörige Informationen erkennbar? Werden relevante Einschränkungen gefunden? Gibt es keine ausreichende Grundlage, sollte die Anwendung das anzeigen und eine Rückfrage oder manuelle Bearbeitung ermöglichen.

Eine angezeigte Quelle erleichtert die Prüfung. Sie belegt für sich genommen noch nicht, dass jede Aussage der Antwort daraus hervorgeht.

3. Antworten werden ungeprüft übernommen

Ein Modell kann Daten in einem festgelegten Format liefern. Beispielsweise gibt es aus einem Dokument eine Auftragsnummer, ein Datum und einen Betrag zurück. Damit lassen sich Ergebnisse leichter in der Anwendung verarbeiten.

Ein passendes Format garantiert jedoch keine fachliche Richtigkeit. Der Betrag kann zum falschen Auftrag gehören oder aus einer anderen Stelle des Dokuments stammen. Auch die offizielle Dokumentation zu strukturierten Ausgaben weist auf diese Grenze hin. Quelle: Google

Die Anwendung braucht deshalb eigene Prüfungen. Existiert der Auftrag? Passt er zum angemeldeten Kunden? Ist die vorgeschlagene Änderung im aktuellen Bearbeitungsstand erlaubt?

Ergebnis der KI-Funktion

Prüfung vor der Verwendung

Daten für ein Formular

Format, Pflichtangaben und Abgleich mit der Vorlage

Zuordnung zu einem Auftrag

Existenz des Auftrags und Berechtigung des Nutzers

Entwurf einer Kundenantwort

Fachliche Prüfung und Freigabe vor dem Versand

Vorschlag für eine Statusänderung

Zulässiger Übergang und erforderliche Freigaben

Bei folgenreichen Aktionen würde ich zunächst mit Vorschlägen arbeiten, die ein Mensch bestätigt. Eine spätere Automatisierung lässt sich anhand der tatsächlichen Ergebnisse beurteilen.

4. Zugriffsrechte enden am Chatfenster

Ein Mitarbeiter darf bestimmte Kundenunterlagen in der Anwendung nicht öffnen. Der Assistent findet dieselben Unterlagen jedoch in einer gemeinsamen Dokumentensuche und gibt ihren Inhalt in einer Antwort wieder.

Damit ist die bisherige Zugriffsbeschränkung umgangen. Ein Hinweis im Prompt, vertrauliche Informationen nicht auszugeben, ersetzt keine technische Prüfung.

Die Berechtigung muss bereits beim Abruf der Informationen durchgesetzt werden. Das Modell sollte für die jeweilige Anfrage nur Inhalte erhalten, auf die der Nutzer zugreifen darf. Microsoft beschreibt entsprechende Prüfungen auf Dokumentebene für Such- und RAG-Anwendungen. Quelle: Microsoft

Auch gespeicherte Gesprächsverläufe und zwischengespeicherte Antworten brauchen passende Zugriffsbeschränkungen. Wird eine Berechtigung entzogen, muss sich das in den angebundenen Datenbeständen widerspiegeln.

5. Dokumente können das Verhalten der Funktion beeinflussen

KI-Funktionen verarbeiten häufig Inhalte, die Nutzer hochladen oder die aus anderen Systemen stammen. Darin können Anweisungen stehen, die versuchen, das Modell von seiner eigentlichen Aufgabe abzubringen. Das wird Prompt Injection genannt.

Ein hochgeladenes Dokument könnte etwa dazu auffordern, weitere Kundeninformationen abzurufen und in die Antwort aufzunehmen. Solche Inhalte müssen als fremde Daten behandelt werden. Besonders relevant wird das, wenn das Modell Werkzeuge zum Lesen oder Ändern von Daten verwenden kann. Quelle: Anthropic

Für die Integration würde ich daraus klare Grenzen ableiten: Werkzeuge erhalten nur die benötigten Rechte. Jeder Zugriff wird durch die Anwendung geprüft. Änderungen und externe Aktionen bekommen je nach Auswirkung einen Freigabeschritt.

Eine Anweisung an das Modell ist keine Zugriffskontrolle. Welche Daten gelesen und welche Aktionen ausgeführt werden dürfen, muss die Anwendung durchsetzen.

6. Getestet wird nur mit passenden Beispielen

Eine sauber formulierte Anfrage eignet sich gut für eine Demo. Im Alltag fehlen Angaben, Kunden verwenden andere Begriffe oder ein Dokument enthält mehrere widersprüchliche Aussagen.

Für die Prüfung brauchst du einen festen Satz von Testfällen mit beschriebenen Erwartungen. Dazu gehören gewöhnliche Vorgänge und Fälle, bei denen die Funktion keine eindeutige Antwort liefern sollte. Anthropic empfiehlt, Bewertungen an konkreten Erfolgskriterien und realistischen Aufgaben auszurichten. Quelle: Anthropic

Für eine Funktion zur Anfrageauswertung würde ich beispielsweise prüfen:

  1. Eine vollständige Anfrage mit eindeutiger Auftragsnummer.
  2. Eine Anfrage ohne Auftragsnummer.
  3. Eine Nachricht mit zwei verschiedenen Aufträgen.
  4. Eine Frage, deren Antwort in den vorhandenen Unterlagen fehlt.
  5. Eine Datei mit einer manipulativen Anweisung.

Lege je Fall fest, was übernommen werden darf und wann eine Prüfung nötig ist. Nach Änderungen am Modell, an den Anweisungen oder an der Dokumentensuche werden diese Fälle erneut geprüft.

7. Wartezeiten und Fehler sind im Ablauf nicht vorgesehen

Der Nutzer startet eine Auswertung und sieht lange keine Rückmeldung. Er klickt erneut. Im Hintergrund laufen nun mehrere Anfragen, während unklar bleibt, welches Ergebnis zu welchem Versuch gehört.

Auch die Bedienung gehört zur Integration. Die Anwendung sollte anzeigen, ob ein Vorgang läuft, abgeschlossen wurde oder fehlgeschlagen ist. Eingaben müssen bei einem Fehler erhalten bleiben. Für längere Verarbeitungen kann ein Hintergrundauftrag sinnvoll sein, dessen Status später wieder aufgerufen wird.

Wiederholungen brauchen ebenfalls Regeln. Wenn nach einer Auswertung eine Nachricht versendet oder ein Datensatz angelegt wird, muss verhindert werden, dass derselbe Vorgang mehrfach ausgeführt wird.

Nutzer brauchen einen funktionierenden nächsten Schritt, wenn die KI-Funktion ausfällt. Das kann eine erneute Auswertung, eine manuelle Eingabe oder die Übergabe an einen Mitarbeiter sein.

So würde ich die Integration vorbereiten

Für den ersten Umfang würde ich eine einzelne Aufgabe auswählen und ihren Ablauf vollständig beschreiben. Danach werden die benötigten Daten, Zugriffsrechte, Prüfungen und Fehlerfälle festgelegt. Erst dann lässt sich die Funktion so entwickeln, dass sie in den bestehenden Arbeitsablauf passt.

Wenn du bereits eine Idee hast, beschreibe mir, welche Aufgabe die Funktion übernehmen soll und was anschließend mit dem Ergebnis passiert. Wir prüfen, welche Daten und Verbindungen dafür gebraucht werden und wie sich der Nutzen vor einer breiteren Einführung testen lässt.