Ein paar Monate lang hast du an deinem Schreibprompt gearbeitet, also an den Anweisungen, die du der KI vor jedem Text mitgibst. Irgendwann kamen die Texte endlich so raus, wie du sie haben wolltest, und seitdem liegt der Prompt gespeichert bereit wie ein bewährtes Rezept. Dann bekommt ChatGPT oder Claude ein neues Modell, also eine neue Version der KI hinter dem Chatfenster. Mit einem Mal wirkt dasselbe Rezept steif. Manche Anweisungen verpuffen, andere liefern Sätze, die dir vorher nie untergekommen sind.

Willst du deinen Prompt verbessern, liegt der erste Verdacht beim neuen Modell. Kann sein, dass es schlechter schreibt. Ich halte es aber für wahrscheinlicher, dass inzwischen dein eigener Prompt bremst, und dann ist die nächste Regel ziemlich sicher der falsche Weg.

Dein Prompt wurde für ein bestimmtes KI-Verhalten gebaut

Schau dir mal die Regeln in deinem Prompt an und überleg bei jeder, wann sie reingekommen ist. Viele davon sind Antworten auf etwas, das dich an einem bestimmten Tag an einer bestimmten KI genervt hat. Typische Kandidaten sehen so aus:

Keine unnötigen Zusammenfassungen.

Vermeide künstliche Übergänge.

Keine Dreierlisten.

Verwende weniger Metaphern.

Beginne nicht jeden Absatz mit einer Einordnung.

Mit gutem Schreiben an sich haben diese Sätze wenig zu tun. Jeder davon reagiert auf etwas, das ein Modell damals zu oft gemacht hat. Die Dreierlisten-Regel kam rein, weil in jedem zweiten Absatz drei Adjektive hintereinander standen. Und die Regel gegen Einordnungen stammt aus der Zeit, als jeder Absatz erst mal erklärt hat, worum es gleich gehen wird.

Der Anlass selbst steht nirgends im Prompt. Die Regel steht da wie ein allgemeines Schreibgesetz und nach einem halben Jahr weißt du selbst nicht mehr, gegen welches Problem sie mal gedacht war. Eine pauschale Gegenanweisung bringt da auch wenig. Im Artikel darüber, warum „schreib menschlicher“ nicht reicht, steht, woran das liegt.

Aus zehn sinnvollen Regeln werden irgendwann fünfzig

Schreibprompts wachsen fast immer nur in eine Richtung. Ein Text geht daneben und du ergänzt eine Regel. Beim nächsten Text hakt es woanders und schon steht Regel Nummer elf drin. Gelöscht wird so gut wie nie, weil eine alte Regel ja nicht stört, solange du nicht merkst, dass sie stört.

Ein Prompt nach einem Jahr erinnert deshalb an einen Kühlschrank, in dem noch das Senfglas von vorletztem Sommer steht. Keiner traut sich, es wegzuwerfen, es könnte ja noch gut sein. Nichts gegen Senf, aber irgendwann ist das Fach voll.

Anthropic, der Hersteller von Claude, hat für dieses Muster in seinem Prompt Audit, einer Prüfanleitung für Entwickler, sogar einen eigenen Begriff. Von der Recency-Falle ist dort die Rede, wenn ein einzelner Ausrutscher aus einer einzigen Sitzung als Dauerregel im Prompt landet. Mein eigener Schreibstil-Skill, also die Datei mit meinen Stilregeln, die Claude bei jedem Text mitliest, ist über Wochen auf ähnliche Weise gewachsen. Nach jedem Block Regeln habe ich die Texte gelesen und nachgebessert. Manches kam dazu und manches wurde wieder weniger.

Irgendwann schleichen sich so Regeln ein, die einzeln vernünftig klingen und sich gemeinsam in die Quere kommen:

Regel A

Schreibe kurze und direkte Sätze.

Regel B

Variiere die Satzlängen stark und verwende auch längere Satzkonstruktionen.

Regel A kam vielleicht rein, als die KI Bandwurmsätze produziert hat. Regel B folgte Monate später, weil die Texte danach abgehackt klangen. Jetzt soll das Modell beiden gleichzeitig folgen.

Anthropic beschreibt in einem Artikel über Kosten und Leistung einen Test mit einem Kundenservice-Prompt. Dort haben widersprüchliche Regeln zur Rückerstattung dazu geführt, dass Erstattungen zurückgehalten wurden. Neuere Modelle befolgen solche Widersprüche laut Anthropic zu wörtlich. Was das bei einem Schreibprompt auslöst, hat niemand gemessen, zumindest kenne ich keinen solchen Test. Ich vermute aber, dass manche unruhigen Texte, bei denen du den Grund nicht benennen kannst, aus solchen Regelpaaren kommen.

Bei mir hat ein Test so einen Widerspruch sichtbar gemacht. Mein Blog-Skill für eine andere Website, hat damals erfundene Ich-Beispiele noch erlaubt, mein Schreibstil-Skill hatte sie inzwischen verboten. Aufgefallen ist das erst, als ich mir direkt nach einer Überarbeitung einen Testartikel habe schreiben lassen. Eine der beiden Regeln musste raus und ich habe entschieden, dass nichts mehr erfunden wird. Gelöscht habe ich Regeln bisher nur ab und zu, meistens dann, wenn sich zwei davon gebissen haben.

Mit der bloßen Menge hat das wenig zu tun. Fünfzig Regeln können wunderbar funktionieren. Zum Problem werden einzelne davon, sobald sie das aktuelle Modell in eine Richtung schieben, die es gar nicht mehr braucht.

Manche deiner Regeln lösen ein Problem, das nicht mehr existiert

In deinem Prompt stehen zwei Sorten Regeln, die gleich aussehen und völlig unterschiedlich altern. Die eine Sorte beschreibt dich. Die andere beschreibt eine bestimmte KI zu einem bestimmten Zeitpunkt.

Sorte 1: deine Stilregeln

„Schreib in Du-Form“ gehört zur ersten Sorte. Diese Regel stand im Prompt, bevor die KI überhaupt einen Fehler gemacht hatte, und sie gilt für jedes Modell, das je kommt, weil sie aus deinem Kopf stammt.

Sorte 2: KI-Reparaturen

„Hör auf, jeden Text mit einer Zusammenfassung zu beenden“ gehört zur zweiten Sorte. Irgendein Modell hat mal fast jeden Text mit einer Wiederholung des Gesagten beendet und du hast dagegen angeschrieben. Macht das Modell, mit dem du heute arbeitest, das gar nicht mehr, steht die Regel ohne Aufgabe im Prompt. Befolgt wird sie trotzdem, bei jedem einzelnen Text.

Leider lässt sich nicht jede Regel so sauber einsortieren. In meinem Prompt steht eine Regel gegen den langen Gedankenstrich. Ganz ehrlich, ich weiß nicht mal, wo der auf meiner Tastatur liegt, bei mir kommt er praktisch nur über KI-Text rein. Insofern ist die Regel Geschmack. Gleichzeitig ist sie eine Reparatur, weil ChatGPT mir früher trotz ausdrücklicher Anweisung immer wieder Gedankenstriche geliefert hat, dazu Einstiege wie „In einer Welt, in der …“. Zwei, drei eBooks habe ich damals gar nicht erst verkauft, der KI-Beigeschmack war zu stark.

Am Wortlaut erkennst du also nicht, zu welcher Sorte eine Regel gehört. Entscheidend ist ihre Herkunft. Anthropic behandelt im Prompt Audit Verbote, die nur einen unerwünschten Schreibstil beschreiben und keinen nachvollziehbaren Anlass haben, ausdrücklich als Kandidaten zum Streichen. Übertragen auf deinen Schreibprompt bleibt eine Regel, die aus deinem Geschmack kommt, bei jedem Modell stehen. Eine Regel, die nur eine KI-Macke abfängt, ist so lange etwas wert, wie die Macke noch auftritt.

Warum ein besseres Modell mit deinem alten Prompt schlechter schreiben kann

Dass ein besseres Modell schlechter schreibt, hat einen einfachen Grund. Anthropic schreibt im Prompt Audit, dass Prompts mit der Zeit Anweisungen ansammeln, die auf ältere Modelle zugeschnitten waren. Die aktuellen Claude-Modelle befolgen Anweisungen genauer und wörtlicher als die Modelle, für die viele dieser Texte geschrieben wurden. Einzelne veraltete Anweisungen verschlechtern das Verhalten dann aktiv, etwa weil das Modell zu oft auf sie anspringt oder in Grenzfällen starr reagiert.

Das betrifft nicht nur Claude. OpenAI hat im Prompting-Leitfaden zu GPT-4.1 fast dasselbe über das eigene Modell geschrieben. Es halte sich enger und wortgetreuer an Anweisungen als seine Vorgänger, die die Absicht dahinter freier erraten hätten. Bestehende Prompts müssten deshalb angepasst werden. Warum neuere Modelle trotz aller Fortschritte oft gleich klingen, habe ich beim KI-Paradox beschrieben.

Wie so ein Übersteuern aussieht, zeigt ein Fall aus meinem eigenen Schreibstil-Skill. Frühere Modelle haben vor fast jedem „und“ ein Komma gesetzt.

Im Skill stand deshalb mal ein absolutes Verbot, kein Komma vor „und“, egal wo. Das hat damals repariert, was kaputt war.

Bei einem Modell, das die Kommaregeln im Griff hat, würde dasselbe Verbot aber auch Kommas streichen, die die Rechtschreibung verlangt. Gemeint sind Stellen, an denen direkt vor dem „und“ ein Nebensatz endet.

Heute steht im Skill, dass vor „und“ nur dann ein Komma steht, wenn die Rechtschreibung es verlangt. Dazu kommt ein Vermerk, dass das strenge Verbot zurückkommt, sobald die alte Macke wieder auftaucht.

Eins muss ich dabei sauber trennen. Der Prompt Audit richtet sich an Entwickler, die Claude in eigene Anwendungen einbauen. Die Übertragung auf deinen Schreibprompt im Chat ist meine Schlussfolgerung, weil auch der nur aus Anweisungen an ein Modell besteht. Getestet hat Anthropic das für Schreibprompts nicht.

Dass lange Prompts schlecht sind, steht in der Anleitung nirgends. Einen Prompt nur wegen seiner Länge zu kürzen, lehnt Anthropic dort ausdrücklich ab. Hintergrundwissen über Leser und Qualitätsanspruch zählt dort nie als Ballast und Verbote gegen Fehler, die das aktuelle Modell nachweisbar noch macht, bleiben stehen.

Hör auf, deinen Schreibprompt immer nur zu erweitern

Nach einem schlechten Text greifst du fast automatisch zur nächsten Regel. Nachvollziehbar ist das schon, weil es sich nach Handeln anfühlt. Nur wächst dein Prompt damit weiter um die Sorte Regeln, die beim nächsten Modellwechsel veraltet. Mit dem üblichen Rat „Prompts regelmäßig aktualisieren“ kommst du da auch nicht weiter, weil er dir nicht sagt, wonach du suchen sollst. Du öffnest den Prompt, liest ihn durch, findest alles irgendwie richtig und schließt ihn wieder.

Drei Fragen an jede Regel

Nimm dir stattdessen jede Regel einzeln vor und stell ihr diese drei Fragen. Jede Frage nimmt dir eine Ausrede weg.

Frage 1

Welches Problem soll diese Regel verhindern?

Die erste Frage zwingt dich, den Anlass zu benennen. Bei einer Stilregel wie der Du-Form läuft sie ins Leere, weil es kein Problem gibt, das die Regel verhindert. Genau daran erkennst du deine Stilregeln und kannst sie in Ruhe lassen.

Frage 2

Tritt dieses Problem beim aktuellen Modell überhaupt noch regelmäßig auf?

Die zweite Frage prüft, ob die Macke noch lebt. Das beantwortest du an echten Texten, nicht aus dem Gedächtnis.

Frage 3

Wird das Ergebnis tatsächlich schlechter, wenn ich die Regel entferne?

Die dritte Frage lässt sich nur mit einem Test beantworten. Wie der aussieht, steht direkt hier drunter.

Prompt verbessern ohne Bauchgefühl: der A/B-Test

A/B-Test heißt nur, dass du zwei Versionen vergleichst, die sich in einem einzigen Punkt unterscheiden. So gehst du vor:

  1. Such dir eine Regel aus, bei der du unsicher bist. Nimm nur diese eine, damit du hinterher weißt, woher ein Unterschied kommt.
  2. Kopier deinen kompletten Prompt zweimal in ein Textdokument. In Version A bleibt die Regel drin, in Version B löschst du sie.
  3. Öffne einen neuen Chat, in dem sich die KI nicht an frühere Gespräche erinnert, bei ChatGPT etwa einen temporären Chat, bei Claude einen Inkognito-Chat. Sonst mischen sich alte Gespräche in den Vergleich.
  4. Schick Version A mit einer Schreibaufgabe ab. Die Vorlage dafür steht unter der Liste.
  5. Öffne einen zweiten neuen Chat und schick dort Version B mit derselben Aufgabe ab.
  6. Wiederhol das mit mindestens drei verschiedenen Aufgaben, zum Beispiel einer E-Mail an einen Kunden und einem Absatz für deine Webseite. Ein einzelner Text kann Zufall sein, weil die KI dieselbe Anweisung jedes Mal etwas anders umsetzt.
  7. Leg die Ergebnisse nebeneinander. Achte auf Satzrhythmus, Wiederholungen, künstliche Übergänge, unnötige Erklärungen und typische KI-Muster. Zähl außerdem, wie oft du der KI bei jeder Version sagen müsstest, was nicht passt. Diese Zahl ist dein Nacharbeitsaufwand.
  8. Schneidet Version B mindestens genauso gut ab, fliegt die Regel raus. Liegt Version A bei allen Aufgaben vorn, lässt du sie drin.

Die Vorlage kannst du so kopieren:

[hier deinen kompletten Schreibprompt einfügen, Version A oder B]

Schreib mir auf dieser Grundlage [Textart, z. B. eine kurze E-Mail an einen Kunden, dessen Lieferung sich verzögert]. Hintergrund: [zwei, drei Sätze dazu, worum es geht und an wen der Text geht].

So kann ein Unterschied aussehen, hier als ausgedachtes Beispiel für die Regel „Keine Metaphern, keine bildhafte Sprache“:

Mit Regel

„Die Lieferung verzögert sich. Die Ursache liegt bei unserem Lieferanten. Wir informieren Sie über einen neuen Termin.“

Ohne Regel

„Ihre Lieferung hängt leider noch bei unserem Lieferanten fest. Sobald ich einen neuen Termin habe, melde ich mich bei Ihnen.“

Die erste Fassung liest sich wie ein Formular, weil das Modell jedes bildhafte Wort meidet, sogar ein harmloses „festhängen“. So eine Regel kostet dich mehr, als sie bringt.

Frag die KI beim Test nicht, ob sie die Regel braucht. Anthropic rät ausdrücklich, das tatsächliche Verhalten vorher und nachher zu prüfen, statt sich auf die Selbstauskunft des Modells zu verlassen. Wird der Text ohne die Regel schlechter, nimm sie in der kürzesten Form wieder auf, die dir einfällt, und teste noch mal, so wie es auch die Prüfanleitung empfiehlt.

Prompt verbessern: dein Stil in ein Fach, die KI-Reparaturen ins andere

Aus all dem folgt eine einfache Ordnung. Teil deinen Schreibprompt in mindestens zwei Bereiche auf.

Fach 1: Mein Schreibstil

Unter „Mein Schreibstil“ stehen Ton, Anrede, Wortwahl, Aufbau und deine persönlichen Eigenheiten, also alles, was du auch einem menschlichen Texter sagen würdest.

Fach 2: Aktuelle KI-Korrekturen

Unter „Aktuelle KI-Korrekturen“ landet alles, was eine Schwäche des Modells abfangen soll, mit dem du gerade arbeitest. Schreib zu jeder Korrektur kurz dazu, welches Modell den Fehler gemacht hat und wann.

Beim nächsten Modellwechsel prüfst du dann vor allem dieses zweite Fach und musst nicht deinen ganzen Stil infrage stellen. Anthropic empfiehlt im Prompt Audit ohnehin, Prompts bei jeder neuen Modellversion neu zu prüfen, weil sie immer zu einem bestimmten Modell gehören.

Dass die Reparaturen mit jedem Modell wechseln, sehe ich an meinem eigenen Skill. Die alte Komma-Macke ist weg. Dafür sind zwei Regeln dazugekommen, die sich ausdrücklich gegen Eigenheiten neuerer Modelle richten. Die eine verhindert zu dichte Absätze mit langen Sätzen, die andere begrenzt Klammern auf eine pro Text.

Offen gesagt stehen Stilregeln und Reparaturen bei mir auch noch nicht in zwei getrennten Bereichen. Bei manchen Regeln steht der Anlass dabei, bei anderen fehlt er noch.

Das Ziel ist also kein Prompt mit möglichst vielen Regeln. Du willst möglichst wenige, bei denen du weißt, warum sie drinstehen und welchen Unterschied sie machen. Ein guter Schreibauftrag besteht im Kern aus deinem persönlichen Schreibstil und dem Kontext für den einzelnen Text, also für wen er ist, wozu er dient und was der Leser schon weiß. Dazu kommen die Korrekturen, die das aktuelle Modell tatsächlich noch braucht. Die ersten beiden Teile bleiben lange gültig. Der letzte hat ein Verfallsdatum.

Das KI-Klang-Handbuch

Für die zweite der drei Fragen musst du KI-Muster erkennen können, sonst merkst du gar nicht, ob eine alte Macke noch auftaucht. Im KI-Klang-Handbuch zeige ich dir, woran du diese Muster erkennst und wie du der KI beibringst, sie zu lassen.

Wächst dein Schreibprompt seit einem Jahr nur in eine Richtung, hilft dir die nächste Regel vermutlich wenig. Nimm dir lieber mal einen Nachmittag Zeit und fang an, Regeln zu löschen.

Sieben Fragen für deine Prompt-Inventur

Geh deinen Prompt Zeile für Zeile durch und stell jeder Regel diese Fragen. Bleibst du bei einer Regel mehrmals hängen, schick sie durch den A/B-Test von oben.

1. Kannst du den Text oder die Situation benennen, nach der du diese Regel geschrieben hast?

Fällt dir nichts ein, weiß das Modell erst recht nicht, wofür sie gut ist.

2. Würdest du diese Regel genauso einem menschlichen Texter sagen, den du zum ersten Mal beauftragst?

Bei Ja gehört sie zu deinem Stil. Fängt sie nur eine KI-Macke ab, gehört sie ins Fach mit den Korrekturen.

3. Stammt die Regel aus einem einzigen schlechten Text?

Ein einmaliger Ausrutscher ist noch keine Gewohnheit des Modells.

4. Steht dieselbe Anweisung schon an anderer Stelle, nur anders formuliert?

Doppelte Regeln driften mit der Zeit auseinander und werden zu Widersprüchen.

5. Beißt sich die Regel mit einer anderen?

Findest du einen Widerspruch, muss eine raus. Ich würde die mit dem älteren Anlass streichen.

6. Steht die Regel in Großbuchstaben oder mit Wörtern wie NIEMALS und UNBEDINGT?

Anthropic zufolge war dieser Druck für ältere Modelle gedacht, heutige springen darauf zu oft an. Schreib sie in normalem Ton.

7. Sagt die Regel nur, was du nicht willst?

Formulier sie um in das, was du stattdessen willst. Auch Anthropic hält eine Beschreibung des gewünschten Ergebnisses für wirksamer als eine Liste von Fehlern.

Gratis KI-Klang-Checkliste runterladen

Die Checkliste zeigt dir an zwölf Beispielen, woran Leser einen KI-Text erkennen, und unter jedem Beispiel steht dieselbe Aussage in einer Fassung, die nach Mensch klingt. Dazu bekommst du einen fertigen Prompt, mit dem ChatGPT oder Claude diese Muster von Anfang an weglässt. Danach erkennst du KI-Klang auf den ersten Blick, egal ob in einem Buch, auf einer Webseite oder in deinem eigenen Entwurf. Deiner KI sagst du dann klar, was sie beim Schreiben bleiben lassen soll.