

Erhalte unsere neuesten Artikel und Updates bequem per E-Mail
KI lernt nicht wie ein Mensch, sondern passt ein mathematisches Modell an Beispieldaten an, bis dessen Ausgaben zum bekannten Ergebnis passen. Die Qualität hängt deshalb weniger vom Algorithmus ab als von Datenqualität, sauberer Trennung von Training und Test und einem klar definierten Ziel. Wer diese drei Punkte versteht, kann Angebote und Pilotprojekte fachlich beurteilen.
Beim maschinellen Lernen wird ein mathematisches Modell so angepasst, dass es in vorhandenen Daten Regelmäßigkeiten erkennt und für neue Eingaben brauchbare Ausgaben erzeugt. Das sind Prognosen, Klassifikationen, Empfehlungen oder generierte Inhalte. Verständnis im menschlichen Sinn entsteht dabei nicht.
Die EU-KI-Verordnung beschreibt KI-Systeme entsprechend als maschinengestützte Systeme, die aus Eingaben ableiten, wie Ausgaben zu erzeugen sind [1]. Das BSI fasst den Begriff weit und versteht KI als Oberbegriff für die Automatisierung intelligenter Entscheidungsvorgänge [2]. Für Sie heißt das: Ein KI-System ist kein Mitarbeiter mit Fachwissen, sondern ein Rechenverfahren mit einem bestimmten Einsatzbereich.
Der Lernvorgang selbst ist schlicht. Es gibt Eingabedaten, einen Zielwert und ein Verfahren, das interne Parameter schrittweise verändert. Soll ein Modell etwa verspätete Lieferungen prognostizieren, dienen historische Aufträge, Plan- und Ist-Zeiten, Strecken und Störungsmeldungen als Eingabe. Der Zielwert lautet „pünktlich“ oder „verspätet“. Das Verfahren verkleinert die Abweichung zwischen Prognose und bekanntem Ergebnis, bis keine Verbesserung mehr eintritt.
Das Resultat ist kein fest programmiertes Regelwerk, sondern ein statistisches Modell. Es kennt keine Regel wie „bei Stau auf der A8 Verspätung“, sondern gewichtet viele Merkmale gleichzeitig. Deshalb lässt sich eine einzelne Entscheidung nicht immer in einem Satz begründen. Genau das macht Prüfung und Dokumentation zur Managementaufgabe.
Drei Lernarten decken die meisten betrieblichen Anwendungen ab: überwachtes, unüberwachtes und bestärkendes Lernen. Sie unterscheiden sich darin, ob richtige Ergebnisse vorliegen, ob das System nach Strukturen sucht oder ob es über Rückmeldungen eine Strategie optimiert. Das Fraunhofer IML ordnet alle drei dem Logistikumfeld zu [3].
Beim überwachten Lernen liegen Trainingsbeispiele samt richtigem Ergebnis vor. Das passt zu Qualitätsprüfung, Nachfrageprognose, Dokumentenklassifikation oder der Vorhersage von Maschinenausfällen. Die Beschriftung der Daten bestimmt den Aufwand: Jemand muss festlegen und prüfen, welches Ergebnis zu welchem Beispiel gehört. Sind diese Beschriftungen inkonsistent, lernt das Modell die Inkonsistenz mit.
Beim unüberwachten Lernen fehlen Zielwerte. Das Verfahren sucht selbstständig nach Ähnlichkeiten, Gruppen oder ungewöhnlichen Abweichungen, etwa bei der Segmentierung von Aufträgen oder bei atypischen Prozessdaten. Weil es kein vorgegebenes „richtig“ gibt, entscheidet erst ein Fachbereich, ob eine gefundene Gruppe geschäftlich etwas bedeutet.
Beim bestärkenden Lernen erhält ein System Belohnungen oder Nachteile und erprobt Handlungsstrategien. Das eignet sich für Simulationen sowie Steuerungs- und Planungsprobleme. Es verlangt eine sehr sorgfältige Festlegung von Ziel und Nebenbedingungen. Wird nur die Fahrzeit belohnt, nicht aber Lenkzeiten oder Zeitfenster der Kunden, optimiert das System genau das Falsche. Wo Planung ohnehin im Fokus steht, hilft ein Blick auf die Automatisierung von Disposition und Routenplanung.
Deep Learning nutzt künstliche neuronale Netze mit vielen Verarbeitungsschichten und erfasst damit komplexe Muster in Bildern, Sprache, Texten und Sensordaten. Klassische Verfahren arbeiten dagegen mit vorab gewählten Merkmalen. Der Preis für die höhere Mustererkennung ist ein größerer Bedarf an Daten und Rechenleistung.
Generative Sprachmodelle werden mit sehr großen Textmengen darauf trainiert, wahrscheinliche Fortsetzungen von Wortfolgen zu erzeugen. Sie berechnen also plausible Ausgaben. Sprachlich überzeugend und trotzdem sachlich falsch kann eine Antwort sein, weil das Modell bei jeder Antwort keinen Wahrheitsnachweis führt.
Daraus folgen Konsequenzen für den Einsatz. Angebotstexte aus einem Sprachmodell brauchen eine Prüfung der genannten Zahlen und Zusagen, bevor etwas den Kunden erreicht. Für unternehmenskritische Prozesse bleiben Quellenprüfung, Freigaberegeln und menschliche Kontrolle erforderlich. Wie sich das bei Bildern konkret auswirkt, beschreibt der Beitrag zur Bildbearbeitung mit KI im Unternehmenseinsatz.
Beim Einkauf sollten Sie daher fragen, welche Aufgabe das Modell löst und womit es dafür trainiert wurde. Allgemeine Sprachmodelle kennen weder Ihre Preislisten noch Ihre Vertragsbedingungen. Sobald es auf solche Daten zugreifen soll, entsteht ein eigener Aufbau mit Datenanbindung, Zugriffsrechten und Prüfregeln. Dieser Aufbau verdient mehr Aufmerksamkeit als die Modellwahl.
Die Qualität eines Modells hängt an den Daten, nicht nur am Verfahren. Das BSI betont die Abhängigkeit des maschinellen Lernens von Qualität und Eignung der Trainingsdaten [2]. Entscheidend sind Relevanz, Repräsentativität, Aktualität, Fehlerfreiheit und die Übereinstimmung mit dem späteren Einsatzgebiet.
Die Daten werden üblicherweise dreigeteilt. Trainingsdaten dienen der Anpassung des Modells, Validierungsdaten der Auswahl von Modellvarianten und Einstellungen, Testdaten der möglichst unabhängigen Abschlussbewertung. Das Fraunhofer IAIS grenzt das Training als Erstellung eines Modells ausdrücklich von der Leistungsmessung mit unabhängigen Validierungs- oder Testdaten ab [4]. Fraunhofer IESE verweist darauf, dass Modelle vor dem Einsatz mit umfangreichen Testdaten validiert werden müssen [5].
Die Trennung hat einen mathematischen Grund. Werden dieselben Daten für Training und Prüfung genutzt, kann das Modell die Beispiele schlicht auswendig lernen. Dieses Overfitting erzeugt gute Laborwerte und schwache Ergebnisse bei neuen Fällen. Umgekehrt übersieht ein zu einfaches Modell Zusammenhänge, die in den Daten stecken.
Zeitliche Daten bergen einen eigenen Reihenfolge-Fallstrick. Mischen Sie bei einer Lieferprognose die Aufträge zufällig auf Training und Test, kennt das Modell bereits die Zukunft des Testzeitraums. Sinnvoller ist es, mit älteren Aufträgen zu trainieren und mit den jüngsten zu testen, weil das den späteren Betrieb nachbildet. Auch Stammdaten wirken hinein: Doppelte Kunden oder uneinheitliche Artikelnummern verfälschen Merkmale, wie die Stammdatenpflege zeigt. Bei Hochrisiko-Systemen verlangt die EU-KI-Verordnung relevante, hinreichend repräsentative und möglichst fehlerfreie und vollständige Trainings-, Validierungs- und Testdatensätze [1].
Gut genug ist ein Modell, wenn es die Fehlerarten, die Ihr Geschäft teuer machen, in einem Maß beherrscht, das Sie vorab festgelegt haben. Die Gesamtgenauigkeit allein sagt dazu wenig. Sie kann täuschen, wenn seltene, aber teure Fehler entscheidend sind.
Die folgende Modellrechnung mit angenommenen Werten macht das sichtbar. Der Testdatensatz umfasst 1.000 Aufträge eines Monats, von denen 100 tatsächlich verspätet waren. Das Modell wird auf diesen bisher nicht für das Training genutzten Fällen geprüft.
| Position | Wert (angenommen) |
|---|---|
| Aufträge im Testdatensatz | 1.000 |
| Tatsächlich verspätet | 100 (10 %) |
| Vom Modell erkannt | 80 (Trefferquote 80 %) |
| Übersehene Verspätungen | 20 |
| Fälschlich als verspätet markiert | 45 von 900 pünktlichen Aufträgen (5 %) |
| Richtig eingeordnete Aufträge | 80 + 855 = 935 |
| Gesamtgenauigkeit | 93,5 % |
| Genauigkeit eines Modells, das stets „pünktlich“ sagt | 90 % |
| Alarme insgesamt | 125 (davon 80 berechtigt, also 64 %) |
| Prüfaufwand Disposition bei 5 Minuten je Alarm | 625 Minuten, rund 10,4 Stunden im Monat |
Die 93,5 % wirken stark, liegen aber nur dreieinhalb Prozentpunkte über einem Modell, das nie warnt und dessen Genauigkeit sich ebenfalls aus der Verteilung der Daten ergibt. Aussagekräftiger sind Trefferquote und Alarmqualität: 20 von 100 Verspätungen bleiben unerkannt, und gut ein Drittel der Alarme ist falsch.
Ob das reicht, ist eine betriebswirtschaftliche Frage. Kostet eine übersehene Verspätung eine Vertragsstrafe und ein Fehlalarm nur fünf Minuten Prüfzeit, kann die Schwelle für Alarme niedriger liegen. Legen Sie diese Abwägung vor dem Test fest und nicht danach, sonst wird die Messlatte dem Ergebnis angepasst.
Nicht zwingend. Viele Systeme werden zunächst trainiert und danach mit einem festgelegten Modellstand betrieben. Aktualisiert wird erst nach kontrollierter Prüfung neuer Daten. Dieser feste Stand macht Ergebnisse nachvollziehbar, weil jede Ausgabe einer dokumentierten Modellversion zugeordnet werden kann.
Kontinuierliches Nachlernen kann sinnvoll sein, erhöht aber die Risiken. Prozessänderungen, fehlerhafte Rückmeldungen oder veränderte Kundenstrukturen verschieben die Modellleistung, ohne dass es auffällt. Wird beispielsweise ein neues Lager eröffnet, passen die gelernten Laufzeiten nicht mehr zur Realität, während die Ausgaben weiterhin plausibel aussehen. Fehlt ein Monitoring, bemerkt das niemand, bis die Folgen in der Auswertung sichtbar werden.
Für den Betrieb braucht es deshalb fachlich geeignete Kennzahlen, dokumentierte Modellversionen, Eskalationswege und klare Verantwortlichkeiten. Die Kennzahlen sollten dieselben sein wie im Test, also etwa Trefferquote und Anteil der Fehlalarme, damit Abweichungen vergleichbar sind.
Auch Bewertungsprozesse profitieren von diesem Denken. Wer etwa die Lieferantenbewertung automatisiert, sollte festlegen, wann ein Mensch Kennzahlen und Auffälligkeiten gegenprüft und wer Änderungen am Verfahren freigibt.
Vor dem Start steht die Übersetzung einer unscharfen Frage in einen prüfbaren Anwendungsfall. „Wo kann KI helfen?“ taugt nicht als Auftrag. Besser: „Lässt sich die Wahrscheinlichkeit einer Lieferverzögerung 24 Stunden vor dem geplanten Warenausgang ausreichend zuverlässig bestimmen?“ Prozessziel, Datenquellen und Entscheidungssituation müssen vor der Modellwahl feststehen.
Die Lage im Markt zeigt, wo die Hürden liegen. Nach Destatis nutzten 2024 insgesamt 20 Prozent der Unternehmen ab zehn Beschäftigten KI, bei mittleren Unternehmen waren es 28 Prozent, bei Großunternehmen 48 Prozent [6]. Von den interessierten Nichtnutzern nannten 71 Prozent fehlendes Wissen als Hindernis [6]. Die Hürde ist also seltener der Algorithmus als die Verbindung aus Kompetenz, Datenorganisation und Prozessverantwortung.
Pragmatisch lässt sich in fünf Schritten vorgehen: einen klar abgrenzbaren, wirtschaftlich relevanten Prozess wählen; Zielgröße, Ausgangswert und akzeptable Fehlerrate festlegen; prüfen, ob geeignete Daten rechtmäßig verfügbar sind; den Piloten mit historischen, nicht für das Training genutzten Fällen testen; danach unter realen Bedingungen überwachen. Erst wenn Nutzen, Risiken, Integrationsaufwand und Verantwortlichkeiten belegt sind, ist eine Skalierung sinnvoll.
Zur Governance gehören ein fachlicher Prozesseigner, eine Stelle für Daten und Modellqualität, Prüfungen zu Datenschutz und Informationssicherheit sowie Regeln für menschliche Aufsicht. Beschäftigte sollten entsprechend ihrem Umgang mit KI qualifiziert werden. Nach dem Recherchestand gelten die Bestimmungen der EU-KI-Verordnung zur KI-Kompetenz seit dem 2. Februar 2025 [1]. Betrachten Sie den gesamten Lebenszyklus von der Zweckbestimmung über Datenherkunft, Training, Prüfung und Einführung bis zur Außerbetriebnahme. Die Kosten eines Projekts hängen dabei von Umfang, Systemlandschaft, Datenqualität und Individualisierungsgrad ab; eine belastbare Einschätzung ist erst nach einer Analyse im Erstgespräch möglich.
Nein, KI entwickelt kein Verständnis, sondern passt ein mathematisches Modell an Daten an. Es erkennt statistische Regelmäßigkeiten und erzeugt daraus Ausgaben für neue Eingaben. Verlässliches Fachwissen entsteht dadurch nicht automatisch.
Weil das Modell sonst Beispiele auswendig lernen kann und die Prüfung nur Auswendiglernen misst. Dieses Overfitting führt zu guten Laborwerten, aber schwachen Ergebnissen bei neuen Fällen. Unabhängige Testdaten bilden den späteren Einsatz nach.
Pauschal nennen lässt sich keine feste Menge, weil Relevanz, Repräsentativität, Aktualität und Fehlerfreiheit mehr zählen als der Umfang. Maßgeblich ist, ob die Daten zum späteren Einsatzgebiet passen. Erst mit Blick auf Ihren konkreten Anwendungsfall gelingt eine Einschätzung.
Ja, denn Prozessänderungen, fehlerhafte Rückmeldungen oder veränderte Kundenstrukturen können die Leistung unbemerkt verschieben. Sinnvoll sind geeignete Kennzahlen, dokumentierte Modellversionen, Eskalationswege und klare Verantwortlichkeiten.
Fragen zur Automatisierung? Kostenloses Erstgespräch mit Socialeap

Abdullah hat Wirtschaftsinformatik (B.Sc.) studiert und verantwortet bei Socialeap den Bereich Prozessautomatisierung. Jede Lösung wird zu 100 % auf den jeweiligen Kunden zugeschnitten – kein Standardpaket, sondern Systeme, die exakt auf die bestehenden Abläufe im Unternehmen passen. Kunden sparen dadurch im Durchschnitt 10 Stunden pro Woche. Abdullah ist bei jedem Automatisierungsprojekt persönlich am Aufbau beteiligt. Auf diesem Blog schreibt er über Automatisierung, Prozessoptimierung und die Frage, wo Zeit im Tagesgeschäft tatsächlich verloren geht.