Werkstattbericht Content-Automatisierung – Teil 7 von 8. Wie ich für einen meiner Blogs die Beitragsproduktion mit n8n und Claude automatisiert habe: was funktioniert hat, was nicht, und was am Ende dabei herauskam. Zu den anderen Teilen: 1 · 2 · 3 · 4 · 5 · 6 · 7 · 8.
Irgendwann in diesem Projekt kam die Frage, die jeder stellt, der KI-Texte produzieren lässt: Wird das besser, wenn ich ein besseres Modell nehme?
Ich habe sie gestellt, weil ich mit den Texten unzufrieden war. Sie waren nicht falsch. Sie waren nicht schlecht gebaut. Sie lasen sich nur wie – nun ja. Wie das, was sie sind.
Die Antwort hat mich überrascht, und sie beginnt mit einer Auszählung.
Dies ist Teil 7 des Werkstattberichts. Es geht um Floskeln, um einen Lektorats-Node mit Notbremse, um Modellpreise und um die Frage, welcher Teil der Textqualität sich überhaupt kaufen lässt.
Zehnmal „entscheidend“
Die Auszählung
Ich habe die fünf Entwürfe aus der aktuellen Workflow-Fassung durchsuchen lassen – nach Verstärkern ohne Inhalt: entscheidend, essenziell, optimal, maßgeblich, gewährleistet, von großer Bedeutung, spielt eine wichtige Rolle, unerlässlich, in diesem Zusammenhang, es ist wichtig.
| Beitrag | Wörter | Floskeln | je 1.000 Wörter |
|---|---|---|---|
| Dreiländereck | 951 | 0 | 0,0 |
| Kelmis | 1.752 | 3 | 1,7 |
| Wildregulierung | 1.471 | 6 | 4,1 |
| Jagdpraktiken | 1.899 | 13 | 6,8 |
| Wildbret-Hygiene | 1.773 | 36 | 20,3 |
Im Wildbret-Beitrag steht zehnmal „entscheidend“ und elfmal „optimal“ auf 1.773 Wörtern. Rechnerisch alle neunundvierzig Wörter eine Floskel.
Und jetzt der Befund, der mich am meisten interessiert hat: Sätze, die inhaltlich dasselbe sagen, gibt es in diesem Beitrag keine. Kein Doppeln von Aussagen, keine Kreisbewegungen. Das Problem sitzt nicht auf Satz-, sondern auf Wortebene.
Warum das der Aufbau ist und nicht das Modell
Die Ursache ist konstruktiv, und wenn man sie einmal sieht, ist sie zwingend:
Jedes Unterkapitel wird von einem eigenen Modellaufruf geschrieben, der die anderen fünf nicht kennt und rund 250 Wörter produzieren soll. Jeder dieser Aufrufe greift zu denselben Verstärkern – „entscheidend“ ist nun einmal das Wort, mit dem man einen Punkt betont, wenn man nicht weiß, was die anderen schon betont haben.
Und niemand sieht das Ergebnis als Ganzes. Sechs Abschnitte, sechs blinde Autoren, kein Lektor.
Ein besseres Modell schreibt dieselben sechs Abschnitte etwas eleganter. Es sieht sie immer noch nicht zusammen.
Das ist der Grund, warum ich zuerst den Aufbau geändert habe und erst danach über Modelle nachgedacht habe. Und es passt zu der Beobachtung aus Teil 3, die ich hier wiederhole, weil sie das Fundament dieses Teils ist: Keiner der Fehler aus den elf Entwürfen war ein Modellproblem. Die Schlachttiere kamen von einem Prompt ohne Themenkontext, die eckigen Klammern von einer Anweisung, nichts zu verändern, die toten Links von maskierten Anführungszeichen, die dreifache Überschrift von einem .first(). Kein Modell der Welt hätte einen davon verhindert.

Der Stil-Node und seine Notbremse
Was er darf und was nicht
Zwei neue Nodes, eingehängt nach der Bereinigung und vor der Linkplanung – damit die Ankertexte auf der endgültigen Fassung gewählt werden:
Bereinigung → Stil überarbeiten → Überarbeitung prüfen → Interne Links planen → …
Was er ändern darf: Füllwörter streichen, Wortwiederholungen auflösen, mehrfach Erklärtes zusammenziehen, Übergänge glätten, lange Sätze teilen, Nominalstil auflösen.
Was er nicht anfassen darf: keine Überschrift, keine Zahl, keine Einheit, keinen Eigennamen, keine Artbezeichnung, keinen Sachverhalt, keine Links – und die Länge um höchstens zehn Prozent.
Das ist eine Menge Verbote, und genau deshalb kommt gleich der zweite Node.
Fünf beschädigte Fassungen
Ein Lektorats-Modell verliert etwas. Immer. Es kürzt eine Zahlenangabe zu „etwa drei Viertel“, weil das schöner klingt. Es benennt eine Überschrift um. Es streicht einen Nebensatz, in dem eine Einschränkung stand.
Der Node „Überarbeitung prüfen“ vergleicht deshalb vorher und nachher und verwirft die Überarbeitung, wenn der Text um mehr als 15 % schrumpft oder wächst, eine Überschrift verändert wurde oder eine Zahlenangabe verschwunden ist. Dann bleibt schlicht das Original stehen.
Getestet habe ich das gegen den echten Wildbret-Beitrag, mit fünf absichtlich beschädigten Fassungen:
| Fall | Ergebnis |
|---|---|
| Text auf 60 % gekürzt | verworfen — „Text um 41 % geschrumpft“ |
| „Fazit“ zu „Zusammenfassung“ umbenannt | verworfen — „1 Überschrift verändert“ |
| „75 %“ zu „etwa drei Viertel“ | verworfen — „3 Zahlenangaben verschwunden“ |
| leeres Ergebnis | verworfen |
| realistische Überarbeitung | übernommen — „Floskeln 35 → 8, Länge 1.785 → 1.785 Wörter“ |
Die letzte Zeile ist das Ergebnis, um das es geht: 35 Floskeln auf 8, bei identischer Wortzahl. Es wurde nicht gekürzt, sondern ersetzt.
Das Ergebnis steht als Klartext in einer Tabellenspalte, und die Spalte „Prüfung nötig“ schlägt an, wenn eine Überarbeitung verworfen wurde. Kosten: ein zusätzlicher Aufruf über den ganzen Artikel, rund 3.000 Token hinein und 3.000 hinaus. Auf der mittleren Preisstufe sind das etwa vier Cent pro Beitrag – bei vierzehn Beiträgen die Woche unter einem Euro.
Das Muster ist dasselbe wie bei den Links in Teil 5: Ein Modell darf vorschlagen. Eine mechanische Prüfung entscheidet, ob der Vorschlag übernommen wird. Und im Zweifel passiert nichts.
Die Modellfrage
GPT-4o steht nicht mehr auf der Liste
Bevor ich aus dem Gedächtnis geantwortet habe, habe ich nachgesehen, was tatsächlich angeboten wird. Und der erste Befund war schon aufschlussreich: GPT-4o steht auf der aktuellen Modellübersicht von OpenAI gar nicht mehr. Mein Workflow lief an allen sieben Textnodes darauf.
Aufgeführt sind stattdessen drei Stufen der GPT-5.6-Reihe (Stand 22.08.2026, je 1 Mio. Token):
| Modell | Eingabe | Ausgabe |
|---|---|---|
gpt-5.6-sol | 4 $ | 20 $ |
gpt-5.6-terra | 2 $ | 12 $ |
gpt-5.6-luna | 0,20 $ | 1,20 $ |
Und weil ich für die Prosa Claude in die engere Wahl genommen habe, hier die Gegenseite:
| Modell | Eingabe | Ausgabe |
|---|---|---|
| Claude Fable 5 | 10 $ | 50 $ |
| Claude Opus 5 | 5 $ | 25 $ |
| Claude Sonnet 5 | 2 $ | 10 $ |
| Claude Haiku 4.5 | 1 $ | 5 $ |
Zwei Anmerkungen, die man kennen sollte: Claude Sonnet 5 war zum Zeitpunkt meiner Recherche mit 2 $ / 10 $ günstiger als Sonnet 3.5 (3 $ / 15 $) – also günstiger als sein eigener Vorgänger von 2024. Und dieser Preis war ausdrücklich befristet. Preise in diesem Feld veralten schneller als Blogbeiträge; prüf sie nach, bevor du damit rechnest.
Aufteilung nach Aufgabe, nicht nach Marke
Die eigentliche Erkenntnis war aber nicht, welches Modell gewinnt, sondern dass die Frage falsch gestellt ist. Ein Workflow mit neun Modell-Nodes hat neun verschiedene Aufgaben:
| Aufgabe | Stufe |
|---|---|
| Recherche-Agenten – reichen im Wesentlichen das Perplexity-Ergebnis durch | billigste |
| JSON reparieren | billigste |
| Struktur, Titel, Meta, Keyphrase | mittlere |
| Linkplanung – muss Phrasen buchstabengetreu aus dem Text ziehen | mittlere, regeltreu |
| Kapiteltext, Unterkapiteltext, Stil – hier entsteht die Prosa | die beste, die man sich leisten will |
Die drei Recherche-Nodes sind ungefähr die Hälfte aller Aufrufe und tun am wenigsten. Dort spart die Umstellung auf die günstigste Stufe am meisten, ohne dass es die Textqualität berührt.
Praktisch gemacht habe ich das über OpenRouter. n8n hat dafür einen eigenen Node, der die Modellliste dynamisch aus dem Konto zieht – man sieht im Auswahlfeld genau das, was man tatsächlich nutzen darf, statt Kennungen abzutippen. Eine Zugangsdatei statt drei, eine Abrechnung statt drei, und ein Modellwechsel ist ein Auswahlfeld statt eines Node-Tauschs.
Der erste Umbau ging mir dann allerdings zu weit: alle neun Nodes auf OpenRouter. Ich habe zurückgerudert, und zwar aus einem Grund, den ich für den wichtigsten Betriebsgrundsatz dieses ganzen Projekts halte: Ändere nicht neun Dinge gleichzeitig an einem System, das läuft.
Die Fassung, die tatsächlich in Betrieb ging, stellt drei Nodes um – genau die, in denen deutsche Prosa entsteht. Der Rest bleibt, wo er war. Begründungen für die drei Ausnahmen:
- Der Planer bleibt, weil er die größte strukturierte Ausgabe im ganzen Workflow erzeugt – Titel, Untertitel, Einleitung, Slug, Anriss, Meta, Tags, Keyphrase, Kapitel mit Bildanweisungen, Kategorien. Das läuft heute. Es umzustellen wäre das größte Risiko bei geringstem Gewinn.
- Die Recherche-Nodes bleiben, weil sie Agenten mit einem Werkzeug sind. Wenn das Tool Calling über einen zusätzlichen Vermittler nicht trägt, kommt gar keine Recherche zurück – und die Fehlersuche wird schwerer, ohne dass die Textqualität davon profitiert.
- Die Linkplanung bleibt, weil dort Regeltreue zählt und nicht Sprachgefühl.
Eine Offenlegung, die mich amüsiert hat
Als ich Claude nach einer Modellempfehlung für die Prosa gefragt habe, kam die Antwort mit einer Vorbemerkung, die ich hier zitiere:
„Offenlegung vorweg: Ich bin selbst ein Claude-Modell von Anthropic. Wenn ich unten Claude empfehle, sollten Sie das mit entsprechender Vorsicht lesen.“
Und weiter unten:
„Ich kann Ihnen nicht belegen, dass Claude für Ihre Themen besseres Deutsch schreibt als die GPT-5.6-Reihe. Ich habe es nicht verglichen, und ich bin in dieser Frage befangen.“
Das ist die richtige Antwort auf eine Frage, die sich nicht aus Testberichten beantworten lässt. Der Rat, der daraus folgte, ist der, den ich dir auch geben würde: Nimm ein Thema, lass es zweimal laufen – einmal mit dem einen, einmal mit dem anderen Modell an den drei Textnodes – und lies beide Fassungen nebeneinander. Das kostet ein paar Cent und beantwortet für deine Themen und deine Leser mehr als jeder allgemeine Vergleich. Und dank der Floskelzählung in der Stil-Spalte hast du sogar eine Zahl daneben.

Was das alles kostet
Das Bildmodell und die DALL·E-Reste
Ein Bauteil war noch älter als GPT-4o: Das eingesetzte gemini-2.5-flash-image führt Google in seiner eigenen Dokumentation ausdrücklich als Altmodell mit der Empfehlung, zu wechseln.
Aktuell dokumentiert (Stand 22.08.2026, Preis je Bild in 1K):
| Modell | Auflösungen | Preis |
|---|---|---|
gemini-3.1-flash-lite-image | nur 1K, eingeschränkte Seitenverhältnisse | 0,0336 $ |
gemini-3.1-flash-image | 0,5K · 1K · 2K · 4K, als Allrounder empfohlen | 0,067 $ |
gemini-3-pro-image | 1K · 2K · 4K, für aufwendige Bildaufgaben | 0,134 $ |
Genommen habe ich den mittleren. Der Workflow erzeugt vier Bilder je Beitrag und verkleinert sie anschließend auf 800 Pixel – 2K oder 4K wären Geld für Pixel, die der Verkleinerungs-Node wegwirft. Und die halb so teure Lite-Variante hat „eingeschränkte Seitenverhältnisse“; wenn sie nur quadratisch kann, bekomme ich 1.121 quadratische Titelbilder.
Und dann der Fund, der mich am meisten gefreut hat. In beiden Bildprompts stand am Ende:
"size": "1536x1024",
"n": 1
Das sind Reste eines früheren DALL·E-Aufrufs. Der Gemini-Node liest daraus nichts – die Zeilen gingen als Text an das Bildmodell, zusammen mit der Bildbeschreibung. Das Modell las also wörtlich „size 1536×1024, n 1″ als Teil des Motivs.
Damit ist zugleich klar, dass das Seitenverhältnis bislang gar nicht gesteuert wurde – weder durch diese Zeilen noch durch die Anweisung „16:9″ im Planer-Prompt. Wenn du ein bestimmtes Format willst, muss es in den Optionen des Bildnodes gesetzt werden.
Die Rechnung
| je Beitrag (4 Bilder) | 14 Beiträge/Woche | über alle 1.121 Beiträge | |
|---|---|---|---|
gemini-3.1-flash-image (1K) | 0,27 $ | 3,75 $ | rund 300 $ |
gemini-3.1-flash-lite-image (1K) | 0,13 $ | 1,88 $ | rund 150 $ |
Dazu die Textseite: rund 14 Modellaufrufe und sieben Perplexity-Recherchen je Beitrag mit „Deeper Research = Yes“, etwa die Hälfte davon ohne. Bei vierzehn Beiträgen pro Woche also grob 200 Modellaufrufe, 100 Recherchen und 56 Bilder – wöchentlich.
Ich rechne dir bewusst keine Gesamtsumme vor. Die hängt an Tarifen, an der Recherchestufe je Beitrag und an Preisen, die sich ändern. Was ich empfehle: Sieh dir nach der ersten Woche die Abrechnungen an. Nicht nach dem ersten Monat.
Fazit: der Teil, den man nicht kaufen kann
Wir haben in zwei Tagen aus einem Workflow, der englische Absätze, tote Links, Fußnotenreste, falsche Kategorien und Schlachttiere im Wildbret-Beitrag produziert hat, einen gemacht, der prüft, protokolliert und im Zweifel nichts tut. Das ist viel wert.
Aber ich will diesen Teil nicht mit einer Modellempfehlung beenden, weil das die falsche Schlussfolgerung wäre.
Die Qualität, die eine Seite von tausend anderen unterscheidet, entsteht nicht in diesem Workflow. Ein Stil-Node macht aus generischem Text besseren generischen Text. Was er nicht erzeugen kann, ist der Satz, dass die Bohlenwege im Hohen Venn bei Raureif anders rutschen als bei Regen – weil das jemand wissen muss, der dort gestanden hat.
Der wirksamste Hebel für die Textqualität ist deshalb nicht die Modellwahl. Es sind die zwölf Minuten pro Woche, in denen ich in mein Telefon diktiere, was ich beim letzten Mal draußen tatsächlich gesehen habe – und die in die Beiträge wandern, bevor sie freigegeben werden.
Vier Cent Stil-Node und zwölf Minuten Diktat. Von beidem wirkt das Zweite mehr.
Im letzten Teil ziehe ich Bilanz: was am Ende steht, was noch offen ist, und was ich anders machen würde, wenn ich morgen wieder anfinge.
Alle Teile der Serie
- Teil 1: Null Klicks in drei Monaten
- Teil 2: 120 Nodes geerbt
- Teil 3: Schlachttiere im Wildbret-Beitrag
- Teil 4: Vier Beiträge in zwei Sekunden
- Teil 5: Interne Verlinkung, neu gebaut
- Teil 6: Yoast über die REST-API
- Teil 7: Stil, Modelle und Kosten (dieser Beitrag)
- Teil 8: Bilanz nach zwei Tagen
◀ Zurück zu Teil 6: Yoast über die REST-API | Weiter zu Teil 8: Bilanz nach zwei Tagen ▶


Schreibe einen Kommentar