← Back to list

Wenn Stammdaten denken lernen: LLM-gestuetzte Klassifikation mit Talend

Das Problem: Stammdaten ohne Struktur

Mohamad Naser Alnakshbandi · 2026-03-11 23:18 · 5 claps · 2.4 min read
#data-engineering #artificial-intelligence #talend #data-management #qlik
Open on Medium ↗
Wiki topics: LLM · Large Language Models AI · AI · General CR · CRISPR & Gene Editing BIZ · Business Strategy 🔧 · Data Engineering

Wenn Stammdaten denken lernen: LLM-gestuetzte Klassifikation mit Talend

Das Problem: Stammdaten ohne Struktur

In vielen Unternehmen sieht der Artikelstamm so aus: Tausende Eintraege, aber strukturierte Felder wie Kategorie, Marke oder Produktgruppe sind leer. Was bleibt, ist eine einzige Freitextzeile:

ART-001 BOSCH GBH 2–26 Bohrhammer SDS-Plus 830W

In dieser Zeile stecken alle Informationen — aber unstrukturiert, für Maschinen unsichtbar. Das hat direkte Konsequenzen:

• Filtern nach Marke oder Kategorie? Nicht möglich.

• Berichte nach Produktgruppe? Aufwändig bis unmoeglich.

• KI-Systeme auf den Daten trainieren? Kaum sinnvoll bei reinem Freitext.

• Manuelle Pflege? Dauert Wochen und ist fehleranfaellig.

Genau dieses Problem haben wir bei einem Kunden gesehen — und automatisiert geloest.

Die Idee: Ein Sprachmodell als Klassifikationsmaschine

Sprachmodelle sind bekannt als Grundlage fuer Chatbots. Was weniger diskutiert wird: Sie sind exzellente Klassifikatoren.

Ein LLM kann den Freitext lesen und daraus strukturierte Felder extrahieren:

Der Vorteil gegenüber regelbasierten Ansaetzen (Regex, Mapping-Tabellen): Das LLM versteht Kontext. Es erkennt, dass “GBH 2–26” ein Bosch-Produkt ist — auch ohne explizite Regel. Es generalisiert. Und das nicht für einen Artikel, sondern fuer den gesamten Bestand.

Der Talend Job: Die Pipeline in der Praxis

Der Prompt: Praezision ist alles

Die Qualität der Klassifikation steht und fällt mit dem Prompt. Hier der tatsächlich verwendete Prompt aus dem Projekt:

Klassifiziere diesen Artikel, antworte NUR mit JSON ohne Markdown.
Format: {"ArtikelNr":"...","Kategorie":"...","Unterkategorie":"...","Marke":"..."}

Beispiele:
ART-001 BOSCH Bohrhammer SDS-Plus  -> {"Kategorie":"Elektrowerkzeug", "Unterkategorie":"Bohrhammer", "Marke":"Bosch"}
ART-005 HP LaserJet Toner CF217A   -> {"Kategorie":"Druckerzubehoer", "Unterkategorie":"Toner",       "Marke":"HP"}
ART-010 Knipex Wasserpumpenzange   -> {"Kategorie":"Handwerkzeug",    "Unterkategorie":"Zangen",      "Marke":"Knipex"}

Klassifiziere NUR diesen Text:
[row2.ArtikelNr] + " " + [row2.Artikelbezeichnung]

Was diesen Prompt effektiv macht

  • Few-Shot-Beispiele: Drei Beispiele etablieren das Ausgabeformat zuverlaessig.
  • Strikte JSON-Anweisung: Verhindert, dass das Modell Prosa-Antworten liefert, die schwer zu parsen sind.
  • Kein Markdown: Verhindert Code-Fences wie ```json, die das Parsing brechen wuerden.
  • Dynamischer Kontext: ArtikelNr und Artikelbezeichnung werden direkt aus dem Talend-Datenfluss injiziert.

Flexibilität: On-Premise oder Cloud-KI — deine Wahl

Das besondere an der Architektur: Der LLM-Client ist austauschbar. Talend stellt native Komponenten fuer alle relevanten Anbieter bereit:

Der Wechsel zwischen den Anbietern erfordert in Talend lediglich den Austausch der Client-Komponente — die restliche Pipeline (tMap, tExtractJSONFields, Lookup) bleibt unverändert. Das macht A/B-Tests zwischen Modellen trivial.

Das Ergebnis: Saubere Daten, nutzbare Daten

Nach dem Durchlauf der Pipeline war der Artikelstamm strukturiert:

• Dashboards in Qlik Sense konnten nach Marke, Kategorie und Produktgruppe gefiltert werden

• Berichte wurden vergleichbar und reproduzierbar

• Analysen auf Kategorie ebene wurden erstmals möglich

• Die Daten können jetzt als Input für weitere KI-Prozesse dienen

Wer heute Stammdaten strukturiert, legt die Grundlage dafür, dass KI-Systeme diese Daten morgen sinnvoll verarbeiten können. Das ist kein Zukunftsthema — das ist jetzt relevant.


메타데이터
post_id
050e5b18b2a9
slug
wenn-stammdaten-denken-lernen-llm-gestuetzte-klassifikation-mit-talend-050e5b18b2a9
url
https://medium.com/@Mohamad-Naser-Alnakshbandi/wenn-stammdaten-denken-lernen-llm-gestuetzte-klassifikation-mit-talend-050e5b18b2a9
canonical_url
https://medium.com/@Mohamad-Naser-Alnakshbandi/wenn-stammdaten-denken-lernen-llm-gestuetzte-klassifikation-mit-talend-050e5b18b2a9
author_url
https://medium.com/@Mohamad-Naser-Alnakshbandi
status
ok
fetched_at
2026-07-14 16:51:32