Wenn Stammdaten denken lernen: LLM-gestuetzte Klassifikation mit Talend
Das Problem: Stammdaten ohne Struktur
Wenn Stammdaten denken lernen: LLM-gestuetzte Klassifikation mit Talend
Das Problem: Stammdaten ohne Struktur
In vielen Unternehmen sieht der Artikelstamm so aus: Tausende Eintraege, aber strukturierte Felder wie Kategorie, Marke oder Produktgruppe sind leer. Was bleibt, ist eine einzige Freitextzeile:
ART-001 BOSCH GBH 2–26 Bohrhammer SDS-Plus 830W
In dieser Zeile stecken alle Informationen — aber unstrukturiert, für Maschinen unsichtbar. Das hat direkte Konsequenzen:
• Filtern nach Marke oder Kategorie? Nicht möglich.
• Berichte nach Produktgruppe? Aufwändig bis unmoeglich.
• KI-Systeme auf den Daten trainieren? Kaum sinnvoll bei reinem Freitext.
• Manuelle Pflege? Dauert Wochen und ist fehleranfaellig.
Genau dieses Problem haben wir bei einem Kunden gesehen — und automatisiert geloest.
Die Idee: Ein Sprachmodell als Klassifikationsmaschine
Sprachmodelle sind bekannt als Grundlage fuer Chatbots. Was weniger diskutiert wird: Sie sind exzellente Klassifikatoren.
Ein LLM kann den Freitext lesen und daraus strukturierte Felder extrahieren:

Der Vorteil gegenüber regelbasierten Ansaetzen (Regex, Mapping-Tabellen): Das LLM versteht Kontext. Es erkennt, dass “GBH 2–26” ein Bosch-Produkt ist — auch ohne explizite Regel. Es generalisiert. Und das nicht für einen Artikel, sondern fuer den gesamten Bestand.
Der Talend Job: Die Pipeline in der Praxis
Der Prompt: Praezision ist alles
Die Qualität der Klassifikation steht und fällt mit dem Prompt. Hier der tatsächlich verwendete Prompt aus dem Projekt:
Klassifiziere diesen Artikel, antworte NUR mit JSON ohne Markdown.
Format: {"ArtikelNr":"...","Kategorie":"...","Unterkategorie":"...","Marke":"..."}
Beispiele:
ART-001 BOSCH Bohrhammer SDS-Plus -> {"Kategorie":"Elektrowerkzeug", "Unterkategorie":"Bohrhammer", "Marke":"Bosch"}
ART-005 HP LaserJet Toner CF217A -> {"Kategorie":"Druckerzubehoer", "Unterkategorie":"Toner", "Marke":"HP"}
ART-010 Knipex Wasserpumpenzange -> {"Kategorie":"Handwerkzeug", "Unterkategorie":"Zangen", "Marke":"Knipex"}
Klassifiziere NUR diesen Text:
[row2.ArtikelNr] + " " + [row2.Artikelbezeichnung]
Was diesen Prompt effektiv macht
- Few-Shot-Beispiele: Drei Beispiele etablieren das Ausgabeformat zuverlaessig.
- Strikte JSON-Anweisung: Verhindert, dass das Modell Prosa-Antworten liefert, die schwer zu parsen sind.
- Kein Markdown: Verhindert Code-Fences wie ```json, die das Parsing brechen wuerden.
- Dynamischer Kontext: ArtikelNr und Artikelbezeichnung werden direkt aus dem Talend-Datenfluss injiziert.
Flexibilität: On-Premise oder Cloud-KI — deine Wahl
Das besondere an der Architektur: Der LLM-Client ist austauschbar. Talend stellt native Komponenten fuer alle relevanten Anbieter bereit:

Der Wechsel zwischen den Anbietern erfordert in Talend lediglich den Austausch der Client-Komponente — die restliche Pipeline (tMap, tExtractJSONFields, Lookup) bleibt unverändert. Das macht A/B-Tests zwischen Modellen trivial.
Das Ergebnis: Saubere Daten, nutzbare Daten
Nach dem Durchlauf der Pipeline war der Artikelstamm strukturiert:
• Dashboards in Qlik Sense konnten nach Marke, Kategorie und Produktgruppe gefiltert werden
• Berichte wurden vergleichbar und reproduzierbar
• Analysen auf Kategorie ebene wurden erstmals möglich
• Die Daten können jetzt als Input für weitere KI-Prozesse dienen
Wer heute Stammdaten strukturiert, legt die Grundlage dafür, dass KI-Systeme diese Daten morgen sinnvoll verarbeiten können. Das ist kein Zukunftsthema — das ist jetzt relevant.
메타데이터
- post_id
- 050e5b18b2a9
- slug
- wenn-stammdaten-denken-lernen-llm-gestuetzte-klassifikation-mit-talend-050e5b18b2a9
- url
- https://medium.com/@Mohamad-Naser-Alnakshbandi/wenn-stammdaten-denken-lernen-llm-gestuetzte-klassifikation-mit-talend-050e5b18b2a9
- canonical_url
- https://medium.com/@Mohamad-Naser-Alnakshbandi/wenn-stammdaten-denken-lernen-llm-gestuetzte-klassifikation-mit-talend-050e5b18b2a9
- author_url
- https://medium.com/@Mohamad-Naser-Alnakshbandi
- status
- ok
- fetched_at
- 2026-07-14 16:51:32