BlogKontaktVault entdecken →

Wie eine 15-stufige KI-Pipeline aus RSS-Feeds originale Screen-Inhalte macht

Wie eine 15-stufige KI-Pipeline aus RSS-Feeds originale Screen-Inhalte macht

„Die KI liest einen Artikel und fasst ihn zusammen.” Das ist das mentale Modell, mit dem die meisten Betreiber starten — und genau das Modell, das ein halbes Jahr nach Go-live in einer Abmahnung endet. Zusammenfassung schafft keinen Legal Distance zur Quelle, und das Modell halluziniert ohne Vorwarnung eine Zahl, die auf dem Screen niemandem auffällt.

Die tatsächliche KI-Content-Pipeline besteht aus 15 Stufen. Sieben davon laufen über Claude Haiku, acht sind deterministische Algorithmen. Die Reihenfolge ist nicht zufällig: Jede KI-Ausgabe wird von etwas geprüft, das nicht halluziniert, bevor sie auf einen öffentlichen Screen kommt.

Warum eine Pipeline und nicht ein einzelner Prompt

Ein modernes LLM ist sehr gut darin, Texte zu erzeugen, die richtig klingen. Das ist nicht dasselbe wie ein Text, der faktisch korrekt, quellenverankert, venue-passend, urheberrechtlich sauber und in fünfzehn Sprachen einsatzbereit ist.

Ein einzelner LLM-Aufruf schafft das nicht, weil:

  • Er keine unabhängige Qualitätsprüfung hat
  • Er nicht weiß, welcher Content zu welcher Venue passt
  • Er halluziniert, ohne es zu kennzeichnen
  • Er urheberrechtsrelevanten Content nicht von gemeinfreiem trennt
  • Er zwar in 15 Sprachen parallel generieren kann, sich aber in keiner davon selbst korrigiert

Die 15-stufige Pipeline löst diese Probleme einzeln, mit KI-Stufen, die jeweils von deterministischen Stufen flankiert werden.

Die 15 Stufen

Die Nummerierung läuft 0–13 und springt dann auf 15 — Stufe 14 gibt es nicht. KI-Stufen nutzen Claude Haiku 3 (Stufe 15 Translation nutzt Haiku 4.5); der Rest ist SQL, n-Gramm-Analyse, TF-IDF oder Regel-basiert.

Stufe 0 — Ingestion (deterministisch)

Konnektoren ziehen aus RSS/Atom-Feeds, REST-JSON-APIs, SDMX-Statistik-Endpunkten, GeoJSON-Hazard-Feeds und lizenzierten Sport-/Media-Quellen. Round-Robin-Scheduling, Deduplizierung über (source_id, external_id), noch keine KI. Das Roh-Item landet in PostgreSQL, der Lizenztyp wird mit gespeichert.

Stufe 1 — Fact Extraction (Claude Haiku 3)

Jedes Roh-Item wird über ein erzwungenes JSON-Schema in einzelne Fakten zerlegt: Topic, Akteure, Event, Timeline, Ort, Sektor, Kontext, Bedeutung, Konfidenz. Fakten mit Konfidenz unter 0,1 werden verworfen; strukturierte Daten (Finanz-Zeitreihen, Spielstände) überspringen diese Stufe komplett.

Stufe 2 — Topic Clustering (Haiku 3)

Fakten werden vorab nach Sektor gruppiert — das verkleinert den Suchraum für das Modell — und dann zu Themen-Clustern verdichtet. Zurückgegebene Fact-IDs werden gegen den Batch validiert; halluzinierte IDs fliegen sofort raus. Triviale Gruppen (≤2 Fakten) überspringen das LLM und clustern automatisch.

Stufe 3 — Knowledge Graph (Haiku 3)

Cluster werden zu Knowledge Objects synthetisiert, mit knowledge_type (trend / event / statistic / evergreen) und time_relevance (breaking / current / recent / evergreen). Beide Felder werden gegen feste Enums validiert. Ein 384-dimensionales pgvector-Embedding wird für spätere Ähnlichkeitsprüfungen mitgespeichert.

Stufe 4 — Trend Detection (deterministisches SQL)

Jedes KO wird auf vier gewichteten Dimensionen bewertet: Source Diversity (20%), Geographic Spread (25%), Recency (30%), Signage Relevance (25%). Oberhalb der Trend-Strength-Schwelle (Default 0,3) entsteht ein Trend-Record. Kein LLM, keine Halluzinations-Angriffsfläche.

Stufe 5 — Geo-Localization (deterministisch)

Keyword-Matching gegen ein Geo-Wörterbuch bewertet jedes KO auf Relevanz für die aktivierten Channels. Ein Deutschland-Channel bekommt 0,95 für deutschen Content, 0,5 für EU-Content. Unter 0,3 wird das KO aus diesem Channel gefiltert.

Stufe 6 — Channel Assignment (Haiku 3)

Das LLM entscheidet, auf welchen Channels ein KO laufen soll, und gibt pro Channel den Framing-Angle vor (ökonomischer Angle für einen Business-Channel, Human-Interest-Angle für Lifestyle). Zurückgegebene Channel-IDs werden gegen aktivierte Channels geprüft; ungültige Referenzen werden stillschweigend verworfen.

Stufe 7 — Content Generation (Haiku 3)

Die eigentliche Schreibstufe. Titel ≤ 80 Zeichen, Body ≤ 300 Zeichen für Ticker / ≤ 500 für Fullscreen. Der System-Prompt ist explizit: keine Verweise auf Quellartikel, keine Zitate, kein Übernehmen von Quellformulierungen. Das Modell schreibt aus den extrahierten Fakten und dem zugewiesenen Angle, nicht aus dem Quelltext.

Der generierte Text wird gegen die vollständige Quellenkette geprüft — Content → KO → Cluster → Facts → Raw Item — mit gewichtetem n-Gramm-Overlap (3-Gramme 20%, 4-Gramme 30%, 5-Gramme 50%). Overlap ≥ 0,15 fällt durch und wird von der Publikation ausgeschlossen. Hartes Gate.

Stufe 9 — Deduplication (deterministisches TF-IDF)

Pro Channel werden Items per Kosinus-Ähnlichkeit über TF-IDF-Vektoren verglichen. Alles über 0,85 wird unterdrückt (das niederpriorisierte Item fliegt raus). Kein LLM — scikit-learn macht die Arbeit.

Stufe 10 — Quality Scoring (Haiku 3, unabhängiger Reviewer)

Eine KI-Stufe, die Stufe 7 nie gesehen hat, bewertet deren Output auf Clarity (25%), Readability (30%), Signage Score (30%) und Novelty (15%). Unter 0,35 wird der Beitrag unterdrückt. Scores werden auf [0, 1] geklemmt; nicht parsbare Werte fallen auf 0,5 zurück.

Stufe 11 — Rate Limiter (Venue Policies)

Deterministisches SQL setzt die Regeln der Venue durch: Hard-News-Cap, Politics-Cap, Mindestanteil Light-Content, Topic-Cooldown, Max Wiederholungen pro Stunde. Prioritäts-Boost für Light Content (+0,10) und High-Quality-Items (+0,10); Penalty für übervertretene Sektoren (-0,15).

Stufe 12 — Formatter (Regeln)

Variant-Zuweisung nach Länge: Ticker (≤120 Zeichen, 8s), Card (≤300 Zeichen, 12s), Fullscreen (≤600 Zeichen, 15s), oder data_viz für strukturierte Daten. Image-Matching läuft in vier Stufen: IDF-gewichtetes Tag-Matching, dann Kategorie-Fallback, dann Channel-Default, dann Platzhalter.

Stufe 13 — Publisher (deterministisches Gate)

Fünf Prüfungen: Titel vorhanden, Body vorhanden, legal_distance_pass = true, quality_score gesetzt, Variant zugewiesen. Fehlt eines, bleibt das Item Draft. Bei Veröffentlichung wird die dynamische TTL aus time_relevance gesetzt: 12 Stunden für Breaking, 48 Stunden für Current, 7 Tage für Recent, 30 Tage für Evergreen. Ein SourceTracking-Record zementiert die vollständige Audit-Kette.

Stufe 15 — Translation (Haiku 4.5, on-demand)

Wird ausgelöst, sobald ein API-Request mit ?lang=de (oder einer der 15 unterstützten Sprachen: EN, DE, FR, ES, PT, IT, NL, PL, RU, ZH, JA, KO, AR, HI, TR) eintrifft. Eine Subscription wird angelegt oder reaktiviert; Stufe 15 nimmt sich queued Items in Fünfer-Batches vor. Der erste Batch kann bis zu 24 Stunden brauchen, danach laufen neue Veröffentlichungen praktisch in Echtzeit übersetzt mit.

Wo KI läuft — und wo nicht

Aspekt Einfacher LLM-Prompt 15-stufige Pipeline
Faktische Korrektheit Nicht garantiert Stufe 1 Konfidenzschwelle; Stufe 7 fact-gebundener Prompt
Legal Distance Nicht durchgesetzt Stufe 8 n-Gramm-Check (hartes Gate bei 0,15)
Venue-Relevanz Nicht durchgesetzt Stufen 5, 6, 11
Mehrsprachigkeit Nachträgliche Übersetzung Stufe 15, on-demand, Haiku 4.5
Audit-Fähigkeit Keine SourceTracking-Record bei Stufe 13
Qualitätskontrolle Keine Stufe 10 unabhängiger Reviewer, suppress < 0,35
Halluzinations-Angriffsfläche Gesamter Output Auf 7 KI-Stufen begrenzt, alle hinter Validierung

Sieben KI-Stufen, acht deterministische. Diese Aufteilung ist nicht akademisch — sie ist der Grund, warum ein n-Gramm-Check und nicht ein weiteres LLM den Legal Distance durchsetzt, und warum Deduplizierung über TF-IDF läuft und nicht nur über Embeddings. Überall, wo die KI driften könnte, schaut etwas zu, das nicht driften kann.

Auditierbarkeit ist kein Feature, sondern das Rückgrat

Der SourceTracking-Record bei Stufe 13 verknüpft jedes veröffentlichte Item mit seiner Quelle, dem Raw Item, den Fact-IDs, dem Cluster und dem Knowledge Object. Die Kette ist in beide Richtungen lesbar: vom Screen zurück zur Quelle, oder von einer Quelle vorwärts zu jedem daraus entstandenen Content.

Für Betreiber in regulierten Branchen — Healthcare, Finance, öffentliche Infrastruktur — ist diese Audit-Kette nicht optional. Sie ist die Antwort auf „Woher kommt das?“, wenn jemand fragt. Für alle anderen ist sie die Antwort auf „Warum lief das um 14:32 auf dem Screen?”, wenn eine Beschwerde reinkommt.

Mehr zum rechtlichen Rahmen: Legal Distance und KI-generierter Content. Zu den Fehlermodi, wenn die Halluzinations-Sperre durchbricht: Wenn KI lügt.

Die Größenordnung im Betrieb

266 RSS-Quellen. 20 Channels in fünf Schichten (Global / Regional / National / Light / Venue). 15 Sprachen on-demand. ~11.600 veröffentlichte Items im Bestand, ~1.371 extrahierte Fakten, 1.787 Bilder auf S3.

Pro Tag heißt das: hunderte bis tausende neue Roh-Items laufen durch jede Stufe, parallel für jedes aktive Venue-Profil, in jeder abonnierten Sprache. Ohne manuelles Eingreifen.

Zum Systemüberblick: KI Digital Signage Content Generator.

Illustratives Szenario: ein Feed-Item, 15 Stufen

Wie aus einer regionalen Nachricht ein eigenständiger 35-Wörter-Hotel-Text in fünf Sprachen wird

Illustratives Beispiel, keine Kundenreferenz.

Quelle: Ein regionaler Feed meldet die Eröffnung eines Kulturzentrums in Bonn. Der Originalartikel umfasst rund 800 Wörter mit einem Zitat der Programmleitung und einem Architekten-Hintergrund.

Stufen 0–3 nehmen den Eintrag auf, extrahieren Fakten (Ort, Datum, Programm-Highlights) und synthetisieren ein Knowledge Object, getaggt als event mit time_relevance current. Stufe 4 berechnet die Trend-Stärke; Stufe 5 leitet es auf deutschsprachige Channels. Stufe 6 weist es einem Lifestyle-Channel für Hotel-Venues mit „Kulturempfehlung”-Angle zu.

Stufe 7 schreibt einen 35-Wörter-Hotel-Text aus den Fakten — keine Formulierungen aus der Quelle. Stufe 8 bestätigt, dass der n-Gramm-Overlap deutlich unter 0,15 liegt. Stufen 9 und 10 bestätigen, dass es kein Near-Duplicate ist und 0,62 auf Quality erreicht. Stufe 11 lässt es unter der Hotel-Lobby-Venue-Policy passieren. Stufen 12 und 13 setzen das Card-Variant, hängen ein Bild per Tag-Match an und veröffentlichen mit 48-Stunden-TTL.

Stufe 15 zündet, sobald ein Screen in einem mehrsprachigen Hotel ?lang=fr anfragt — der erste Request meldet Französisch an; innerhalb von 24 Stunden ist der Bestand übersetzt, von da an landen neue Items binnen Sekunden im französischen Feed.

Endzustand: ein 35-Wörter-Hoteltext in fünf Sprachen, eigenständig formuliert, mit vollständigem Audit-Trail. Wall-Clock-Zeit: Minuten.

Screens, die sich selbst aktuell halten contboxx liefert lizenzierte Nachrichten und KI-generierten Content fertig formatiert auf Ihre Displays — mehrsprachig, automatisch, ohne Redaktionsaufwand.

contboxx kennenlernen

Häufig gestellte Fragen

Kann ich nachvollziehen, welche Quelle hinter einem konkreten Screen-Text steht?

Ja. Der SourceTracking-Record verknüpft jedes veröffentlichte Item mit Quelle, Raw Item, extrahierten Fakten, Cluster und Knowledge Object — inklusive Zeitstempel jeder Stufe und Score jeder Prüfung. Für die Frage „Woher kommt diese Zahl?” liefert das Audit-Log die Antwort in Sekunden, nicht in Tagen forensischer Suche.

Wie lange dauert die Verarbeitung durch alle 15 Stufen?

Sekunden bis wenige Minuten pro Item, abhängig von Quelltext-Länge, Zielsprachen und Validierungsergebnissen. Im Massenbetrieb laufen tausende Items pro Stunde durch, ohne dass die Qualität pro Item leidet. Stufe 15 (Translation) läuft on-demand: der erste Batch in einer neuen Sprache kann bis zu 24 Stunden brauchen, danach sind Übersetzungen praktisch in Echtzeit verfügbar.

Was passiert, wenn eine Quelle offline geht?

Die Pipeline hängt nicht an einer einzelnen Quelle. Ingestion läuft Round-Robin über 266 RSS-Feeds plus REST, SDMX, GeoJSON, Sport- und Media-Konnektoren. Fällt eine aus, laufen bereits veröffentlichte Items unter ihrer TTL weiter, während andere Quellen die Pipeline weiter füttern. Praktisch bleibt der Ausfall einer einzelnen Quelle auf dem Screen unsichtbar.

Kann ich eigene RSS-Quellen einbinden?

Ja. Eigene RSS-Feeds — Fachpublikationen, regionale Medien, interne Corporate-Feeds — werden als zusätzliche Quellen konfiguriert und laufen durch dieselben 15 Stufen. Sie bekommen dieselbe Fact Extraction, denselben Legal-Distance-Check, dasselbe Quality-Gate und denselben SourceTracking-Record wie die Standardquellen. Die Lizenzklassifikation pro Quelle bleibt erhalten.

Wo liegt der Unterschied zur Zusammenfassung?

Eine Zusammenfassung kürzt einen vorhandenen Text. Das Urheberrecht bleibt beim Quellautor, und es entsteht kein Legal Distance zur Original-Formulierung. Die Pipeline macht etwas anderes: sie extrahiert Fakten in ein strukturiertes Objekt und schreibt daraus einen eigenständigen Originaltext. Das ist Transformation, nicht Zusammenfassung — und Stufe 8 setzt das operativ durch, nicht nur auf dem Papier.