Human-in-the-Loop bei KI-Automatisierung beschreibt die gezielte Einbindung von Menschen an definierten Stellen eines automatisierten Ablaufs, an denen ein Ergebnis geprüft, korrigiert oder freigegeben wird, bevor es Wirkung entfaltet. Der Begriff stammt aus der Entwicklung lernender Systeme, ist aber für den betrieblichen Alltag längst praktisch relevant: Sobald ein Sprachmodell Anfragen beantwortet, ein Klassifikationsverfahren Rechnungen zuordnet oder ein Agent Bestellvorschläge erzeugt, stellt sich die Frage, wer für ein falsches Ergebnis einsteht und wie ein solcher Fehler rechtzeitig auffällt.
Viele Projekte scheitern an zwei entgegengesetzten Fehlannahmen. Die erste lautet, ein KI-System arbeite so zuverlässig, dass jede menschliche Kontrolle überflüssig sei. Die zweite besagt, jedes Ergebnis müsse vollständig geprüft werden, womit der Effizienzgewinn der Automatisierung wieder verschwindet. Beide Positionen greifen zu kurz, weil sie Kontrolle als Entweder-oder behandeln, obwohl sie sich nach Risiko, Fehlerfolgen und Datenlage abstufen lässt.
Dieser Beitrag zeigt, welche Formen der menschlichen Beteiligung es gibt, nach welchen Kriterien sich Kontrollpunkte festlegen lassen, wie Freigabestufen und Stichproben ausgestaltet werden und welche rechtlichen Anforderungen zu beachten sind. Ein Praxisbeispiel, eine Aufwandsbetrachtung und eine Checkliste unterstützen die Umsetzung. Er richtet sich an Geschäftsführung, Prozessverantwortliche und IT-Leitung.
Titelbild: Foto von Vitaly Gariev auf Unsplash.
Was Human-in-the-Loop bei KI-Automatisierung bedeutet
Im Kern geht es um die Verteilung von Aufgaben zwischen Maschine und Mensch innerhalb eines Prozesses. Die Maschine übernimmt, was sich zuverlässig und in großer Menge erledigen lässt, etwa das Vorsortieren, Extrahieren oder Entwerfen. Der Mensch übernimmt, was Urteilsvermögen, Kontextwissen oder Verantwortung erfordert. Wo genau die Grenze verläuft, ist keine technische, sondern eine organisatorische Entscheidung.
In der Literatur werden drei Grundformen unterschieden. Beim Human-in-the-Loop greift der Mensch aktiv in jeden oder zumindest jeden kritischen Vorgang ein und gibt ihn frei. Beim Human-on-the-Loop läuft der Prozess selbstständig, der Mensch überwacht ihn und kann eingreifen. Beim Human-out-of-the-Loop arbeitet das System vollständig autonom, der Mensch legt nur Rahmenbedingungen fest und wertet nachträglich aus.
| Form | Rolle des Menschen | Typischer Einsatz | Risiko bei Fehlern |
|---|---|---|---|
| Human-in-the-Loop | Prüft und gibt jeden Vorgang frei | Verträge, Preisänderungen, Kundenkommunikation mit rechtlicher Wirkung | Gering, dafür hoher Zeitaufwand |
| Human-on-the-Loop | Überwacht, greift bei Auffälligkeiten ein | Rechnungszuordnung, Ticket-Routing, Terminvorschläge | Mittel, abhängig von der Überwachungsqualität |
| Human-out-of-the-Loop | Definiert Regeln, wertet nachträglich aus | Spam-Filter, Dublettenerkennung, reine Vorsortierung | Hoch, wenn Fehlerfolgen nicht begrenzt sind |
Die Wahl der Form gilt nicht für ein ganzes Unternehmen, sondern für einzelne Prozessschritte. Ein und derselbe Ablauf kann vorne vollständig automatisiert sein und am Ende eine verbindliche Freigabe verlangen.
Warum vollständige Autonomie selten die richtige Lösung ist
Systeme auf Basis maschinellen Lernens liefern Wahrscheinlichkeiten, keine Gewissheiten. Selbst ein Modell, das im Test sehr gut abschneidet, macht Fehler, und diese treten häufig dort auf, wo die Eingabedaten von den Trainingsdaten abweichen. Ein ungewöhnliches Rechnungsformat, ein neuer Produktname oder eine mehrdeutige Kundenanfrage genügen.
Bei generativen Verfahren kommt hinzu, dass Ergebnisse überzeugend formuliert sein können, obwohl sie inhaltlich falsch sind. Ein Entwurf für eine Lieferantenanfrage oder eine Antwort an einen Kunden wirkt dann fertig, enthält aber eine erfundene Zusage oder eine falsche Frist. Ohne Kontrollpunkt gelangt eine solche Aussage ungeprüft nach außen.
Hinzu treten drei betriebliche Gründe für menschliche Beteiligung:
- Verantwortung: Eine Maschine kann nicht haften. Für Entscheidungen im Namen des Unternehmens bleiben Geschäftsführung und zuständige Fachbereiche verantwortlich.
- Lerneffekt: Korrekturen durch Fachpersonal liefern Trainingssignale, mit denen sich Regeln und Modelle verbessern lassen.
- Akzeptanz: Beschäftigte und Kunden vertrauen Systemen eher, wenn erkennbar ist, dass eine Person die Ergebnisse verantwortet.
Kriterien für die Platzierung von Kontrollpunkten
Der wirksamste Weg, Kontrollpunkte festzulegen, ist eine einfache Risikobewertung je Prozessschritt. Sie beantwortet vier Fragen, die sich in einem Workshop mit Fachbereich und IT beantworten lassen.
Fehlerfolgen und Reversibilität
Wie groß ist der Schaden, wenn ein Ergebnis falsch ist, und lässt er sich rückgängig machen? Eine falsch zugeordnete interne Notiz ist harmlos, eine fehlerhafte Zahlungsfreigabe oder eine versendete Zusage an einen Kunden dagegen nur schwer zu korrigieren. Je geringer die Reversibilität, desto früher gehört ein Mensch in den Ablauf.
Unsicherheit des Systems
Viele Verfahren geben einen Konfidenzwert aus, der angibt, wie sicher sich das System ist. Dieser Wert eignet sich als Steuergröße: Ergebnisse oberhalb einer Schwelle laufen automatisch weiter, solche darunter gehen an eine Person. Wichtig ist, die Schwelle anhand echter Betriebsdaten zu kalibrieren, denn die Selbsteinschätzung eines Modells ist nicht automatisch zuverlässig.
Häufigkeit und Volumen
Bei geringen Mengen lässt sich jeder Vorgang prüfen, bei großen Mengen nur eine Auswahl. Das Volumen bestimmt daher, ob eine Vollkontrolle, eine regelbasierte Auswahl oder eine Stichprobe sinnvoll ist.
Rechtliche und vertragliche Vorgaben
Bestimmte Entscheidungen dürfen nicht allein automatisiert getroffen werden, etwa wenn sie gegenüber Betroffenen erhebliche Wirkung entfalten. Auch Kundenverträge oder Zertifizierungen können eine Freigabe durch eine benannte Person vorschreiben.
Freigabestufen und Eskalation praktisch gestalten
Bewährt hat sich ein Modell mit drei Stufen, das Risiko und Aufwand in Einklang bringt. Es lässt sich ohne größeren Technikaufwand in bestehenden Workflow-Werkzeugen abbilden.
- Stufe 1, automatische Verarbeitung: Das System verarbeitet Vorgänge mit hoher Konfidenz und geringer Fehlerfolge selbstständig. Der Ablauf wird protokolliert und ist nachträglich auswertbar.
- Stufe 2, Prüfung durch Fachpersonal: Vorgänge mit mittlerer Konfidenz oder mittlerer Fehlerfolge landen in einer Arbeitsliste. Eine Person prüft, korrigiert und gibt frei. Die Korrektur wird festgehalten.
- Stufe 3, Freigabe durch Entscheidungsberechtigte: Vorgänge mit hohem Schadenspotenzial, ungewöhnlichen Werten oder rechtlicher Wirkung erfordern die Freigabe durch eine dafür benannte Rolle, bei Bedarf nach dem Vier-Augen-Prinzip.
Entscheidend ist, dass jede Stufe eine klare Zuständigkeit, eine Bearbeitungsfrist und einen Eskalationsweg hat. Ohne Frist stauen sich Vorgänge in Arbeitslisten, und das Verfahren wird als Bremse wahrgenommen. Ohne Eskalationsweg bleiben unklare Fälle liegen, weil sich niemand zuständig fühlt.
Ein Kontrollpunkt ohne Zuständigen, Frist und Dokumentation ist keine Kontrolle, sondern eine Wartezeit.
Gestaltung der Prüfoberfläche
Die Qualität der menschlichen Kontrolle hängt stark davon ab, wie das Ergebnis präsentiert wird. Prüfende brauchen den Ausgangsvorgang und das Ergebnis nebeneinander, die Begründung oder die verwendeten Quellen und eine einfache Möglichkeit zur Korrektur. Wer nur ein fertiges Ergebnis mit einem Freigabeknopf sieht, bestätigt erfahrungsgemäß fast alles.
Dieses Phänomen wird als Automation Bias bezeichnet: Menschen neigen dazu, Vorschlägen eines Systems zu folgen, auch wenn sie fehlerhaft sind. Gegenmittel sind Stichproben mit bewusst eingestreuten Prüffällen, wechselnde Prüfende und Kennzahlen zur Korrekturquote. Liegt diese dauerhaft bei null, ist das kein Beleg für Qualität, sondern ein Warnsignal.
Stichproben und laufende Qualitätskontrolle
Auch bei Vorgängen, die automatisch durchlaufen, ist eine nachträgliche Kontrolle sinnvoll. Sie erfolgt über Stichproben, deren Umfang sich am Risiko orientiert. Anfangs wird ein großer Anteil geprüft, bei stabiler Qualität sinkt er.
Ein praktikabler Ansatz sieht eine gestufte Stichprobe vor: In den ersten Wochen eines Einsatzes wird ein hoher Anteil der automatisch verarbeiteten Vorgänge kontrolliert, danach ein geringer, aber fester Anteil, ergänzt um Prüfungen nach Auffälligkeiten. Auffällig sind etwa neue Lieferanten, ungewöhnliche Beträge oder Eingaben, die vom bisherigen Muster abweichen.
- Fehlerquote je Stufe und Vorgangsart, getrennt nach Prüfungsergebnis
- Korrekturquote in Stufe 2, also der Anteil der Vorgänge, die Prüfende ändern
- Durchlaufzeit je Stufe, um Engpässe in Arbeitslisten zu erkennen
- Anteil der Vorgänge, die an Stufe 3 eskaliert werden
- Zeit bis zur Entdeckung von Fehlern, die erst nach der Verarbeitung auffallen
Diese Kennzahlen gehören in ein regelmäßiges Reporting. Steigt die Fehlerquote, werden Schwellenwerte angepasst oder der Prozessschritt zeitweise wieder stärker kontrolliert. Das System lernt damit nicht nur im technischen Sinn, sondern der gesamte Ablauf wird gesteuert.
Rechtliche Anforderungen: DSGVO und KI-Verordnung
Zwei Regelwerke prägen die Anforderungen an menschliche Aufsicht. Artikel 22 der Datenschutz-Grundverordnung gibt betroffenen Personen das Recht, nicht einer ausschließlich auf automatisierter Verarbeitung beruhenden Entscheidung unterworfen zu werden, wenn diese rechtliche Wirkung entfaltet oder sie erheblich beeinträchtigt. Das betrifft etwa Bewerberauswahl, Kreditentscheidungen oder Kündigungen. Eine bloß formale Beteiligung, bei der eine Person Vorschläge ungeprüft übernimmt, genügt dafür nach verbreiteter Auffassung nicht, es muss eine inhaltliche Prüfung mit Entscheidungsspielraum stattfinden.
Die europäische KI-Verordnung (AI Act) verlangt für Hochrisiko-Systeme ausdrücklich eine wirksame menschliche Aufsicht. Die Aufsichtspersonen sollen die Fähigkeiten und Grenzen des Systems verstehen, Ergebnisse richtig interpretieren, Ergebnisse unberücksichtigt lassen können und das System notfalls stoppen. Den Wortlaut der Verordnung stellt EUR-Lex bereit: KI-Verordnung auf EUR-Lex. Ob ein konkreter Einsatz als Hochrisiko-Anwendung einzustufen ist, hängt vom Anwendungsfeld ab und sollte im Einzelfall geprüft werden.
Unabhängig von der Einstufung ist die Dokumentation ratsam: Wer prüft was, nach welchen Kriterien, mit welchem Ergebnis? Diese Angaben dienen dem Nachweis gegenüber Kunden, Prüfern und Aufsichtsbehörden und erleichtern die interne Fehleranalyse.
Praxisbeispiel: Rechnungseingang mit KI-Unterstützung
Ein Maschinenbauunternehmen mit einigen hundert Mitarbeitenden automatisiert den Rechnungseingang. Ein Verfahren liest eingehende Rechnungen aus, ordnet sie Lieferanten und Bestellungen zu und schlägt Kontierungen vor. Zuvor erledigten zwei Personen diese Arbeit vollständig manuell.
Das Unternehmen legt die Kontrollpunkte anhand von Risiko und Konfidenz fest. Rechnungen bekannter Lieferanten mit eindeutiger Bestellzuordnung, passenden Beträgen und hoher Konfidenz laufen automatisch in die Buchungsvorbereitung (Stufe 1). Rechnungen mit abweichenden Mengen, unsicherer Zuordnung oder neuem Layout gehen in eine Arbeitsliste der Buchhaltung (Stufe 2). Rechnungen mit neuen Bankverbindungen oder Beträgen oberhalb einer festgelegten Grenze erfordern die Freigabe durch die Leitung des Rechnungswesens (Stufe 3).
Die Regel für geänderte Bankverbindungen entsteht aus einer Risikoüberlegung: Fehlerhafte Zahlungen sind schwer rückholbar, und manipulierte Rechnungen zielen häufig genau auf diese Angaben. Zusätzlich wird ein fester Anteil der automatisch verarbeiteten Rechnungen wöchentlich nachgeprüft.
Nach einigen Wochen zeigt die Auswertung, welche Lieferanten besonders oft in Stufe 2 landen. Für diese werden die Erkennungsregeln angepasst, die Korrekturquote sinkt, und die Arbeitsliste wird kürzer. Der Gewinn besteht nicht darin, Kontrolle abzuschaffen, sondern sie auf die Fälle zu konzentrieren, in denen sie tatsächlich etwas bewirkt.
Aufwand und Wirtschaftlichkeit realistisch bewerten
Menschliche Kontrolle kostet Zeit, und diese Zeit gehört in die Wirtschaftlichkeitsrechnung. Eine einfache Beispielrechnung veranschaulicht das Prinzip. Angenommen, ein Vorgang dauert manuell zehn Minuten. Mit KI-Unterstützung und Prüfung dauert er im Mittel drei Minuten, weil ein Teil der Vorgänge ohne Prüfung durchläuft und ein anderer Teil eine kurze Kontrolle benötigt. Bei mehreren tausend Vorgängen pro Monat ergibt sich ein erheblicher Zeitgewinn, obwohl jeder zweite Vorgang noch eine Person berührt.
Wichtig ist, auch die verdeckten Kosten zu berücksichtigen: Einrichtung der Arbeitslisten, Schulung der Prüfenden, Pflege der Regeln und Schwellenwerte sowie die Nachbearbeitung von Fehlern, die durchgerutscht sind. Wer nur die eingesparte Bearbeitungszeit betrachtet, überschätzt den Nutzen. Die Zahlen in diesem Absatz sind eine Beispielrechnung und ersetzen keine Messung im eigenen Betrieb.
Häufige Stolperfallen
- Pauschale Vollkontrolle: Wenn jeder Vorgang geprüft wird, entfällt der Nutzen. Kontrolle sollte risikobasiert erfolgen.
- Pauschaler Verzicht auf Kontrolle: Ohne Stichproben bleiben schleichende Qualitätsverluste unbemerkt.
- Unklare Zuständigkeit: Arbeitslisten ohne Verantwortliche und Vertretungsregelung führen zu Staus.
- Fehlende Rückkopplung: Korrekturen fließen nicht in Regeln oder Modelle zurück, sodass dieselben Fehler wiederkehren.
- Überforderte Prüfende: Wer Ergebnisse nicht versteht oder keine Zeit zur Prüfung hat, bestätigt ungesehen.
- Keine Dokumentation: Ohne Protokoll lässt sich weder Verantwortung nachweisen noch Qualität steuern.
Schritt für Schritt zur Einführung
- Prozess auswählen: Mit einem Ablauf beginnen, der hohe Mengen, klare Regeln und begrenzte Fehlerfolgen vereint.
- Prozessschritte bewerten: Fehlerfolgen, Reversibilität, Volumen und rechtliche Vorgaben je Schritt erfassen.
- Stufen und Schwellen festlegen: Konfidenzwerte, Betragsgrenzen und Sonderregeln definieren und mit Echtdaten testen.
- Rollen benennen: Prüfende, Freigabeberechtigte und Vertretungen festlegen, Fristen und Eskalationswege vereinbaren.
- Prüfoberfläche gestalten: Ausgangsdaten, Ergebnis und Begründung nebeneinander zeigen, Korrekturen einfach ermöglichen.
- Pilotbetrieb mit hoher Stichprobe: Anfangs viel prüfen, Kennzahlen erheben und Schwellen anpassen.
- Regelbetrieb und Reporting: Stichprobe reduzieren, Kennzahlen regelmäßig auswerten, Änderungen dokumentieren.
Checkliste für Geschäftsführung und Prozessverantwortliche
- Ist je Prozessschritt festgelegt, ob Human-in-the-Loop, Human-on-the-Loop oder Automatisierung ohne Eingriff gilt?
- Sind Fehlerfolgen und Reversibilität bewertet und dokumentiert?
- Gibt es Schwellenwerte, die anhand von Betriebsdaten geprüft wurden?
- Sind Prüfende und Freigabeberechtigte benannt, einschließlich Vertretung?
- Existieren Fristen und Eskalationswege für unklare Fälle?
- Werden Stichproben auch bei automatisch verarbeiteten Vorgängen gezogen?
- Werden Korrekturquote, Fehlerquote und Durchlaufzeit regelmäßig berichtet?
- Sind Anforderungen aus Datenschutz und KI-Verordnung geprüft?
Wer diese Fragen beantworten kann, hat die Grundlage für eine Automatisierung geschaffen, die schnell und zugleich kontrollierbar bleibt.
FAQ
Was unterscheidet Human-in-the-Loop von Human-on-the-Loop?
Beim Human-in-the-Loop gibt eine Person jeden relevanten Vorgang aktiv frei. Beim Human-on-the-Loop läuft der Prozess selbstständig und die Person überwacht ihn und greift nur bei Auffälligkeiten ein.
Muss bei jeder KI-Anwendung ein Mensch eingebunden sein?
Nein. Die Beteiligung richtet sich nach Fehlerfolgen, Reversibilität, Unsicherheit des Systems und rechtlichen Vorgaben. Bei geringem Risiko genügen nachträgliche Stichproben.
Wie legt man die Schwelle für automatische Freigaben fest?
Die Schwelle wird anhand echter Betriebsdaten kalibriert: Ergebnisse mit unterschiedlichen Konfidenzwerten werden geprüft und die Fehlerquote je Bereich ermittelt. Die Schwelle liegt dort, wo die verbleibende Fehlerquote für den Prozess tragbar ist.
Was ist Automation Bias und wie lässt er sich begrenzen?
Gemeint ist die Neigung, Vorschläge eines Systems ungeprüft zu übernehmen. Gegenmaßnahmen sind eine gute Prüfoberfläche, Stichproben mit Prüffällen, wechselnde Prüfende und die Beobachtung der Korrekturquote.
Wer haftet für Fehler eines automatisierten Ablaufs?
Verantwortlich bleiben das Unternehmen und die für den Prozess zuständigen Personen. Eine Maschine trägt keine Haftung, weshalb Zuständigkeiten und Dokumentation klar geregelt sein sollten.
Weiterlesen
- KI-gestützte Nachfrageprognose im Mittelstand: Von der Bauchentscheidung zum datengestützten Verfahren
- Automatisierungspotenzial im Mittelstand identifizieren: Systematische Prozessanalyse vor der Tool-Auswahl
- Intelligente Dokumentenverarbeitung im Mittelstand: Von der Beleglesung zur automatisierten Verarbeitung









