Moin AInauten,

Willkommen zur neuen Ausgabe deines Lieblingsnewsletters.

Puh, diese Woche ist wieder einiges los an Updates, und wir kommen mit dem Ausprobieren und Testen gar nicht hinterher.

Neue Modelle und AI-Agenten ziehen überall ein. Sogar in dein Auto.

Deshalb heute einmal die News, einmal die Praxis dazu und einmal die Frage, was das alles für dein Setup heißt.

Hier die Themen im Detail:

  • Erst "Bremsen" schreien, dann liefern: Opus 5.5 und GPT-6 im Vergleich

  • 🛠️ 4 Regeln, mit denen du das Meiste aus den neuen Modellen holst

  • 🚗 Agents überall: Warum dein Kontext dir gehören muss

Los geht's!

⚡ Erst "Bremsen" schreien, dann liefern: Opus 5.5 und GPT-6 sind da

Letzte Woche haben wir hier noch über die große Sicherheitsdiskussion geschrieben.

Alle haben laut "BREMSEN" gerufen. Anthropic-Chef Dario Amodei hat ein langes Essay dazu geschrieben.

Titel: "We Must Pace the Frontier." Die AI-Labs sollen das Tempo rausnehmen, damit die Sicherheitsforschung hinterherkommt.

Sam Altman hat noch am selben Tag geantwortet: "I agree with Dario." Elon Musk noch kürzer: "Dario is right."

Zehn Tage später. Dienstag.

Anthropic shippt Claude Opus 5.5. OpenAI shippt am selben Tag GPT-6 Sol und GPT-6 Luna. 😁

Fairerweise: Keines der Modelle schiebt die absolute Spitze nach oben. Opus 5.5 ist ungefähr so gut wie Anthropics großes Fable 5.1, nur deutlich billiger. Sol und Luna bringen die Technik vom großen GPT-6 Astra in günstige Modelle.

Oben kann es also tatsächlich sein, dass etwas gebremst wird. In der Breite wird aber Vollgas gegeben.

Und das ist für uns Anwender genial. Weil billiger, schneller, mehr Leistung natürlich genau das ist, was wir in der täglichen Arbeit brauchen.

Opus 5.5: Wir sind wieder Freunde

Wir haben ja schon einmal darüber geschrieben, dass wir mit Opus 5 nie richtig warm geworden sind.

Für vieles sind wir komplett weg von Claude oder haben zumindest nur noch Fable genutzt. (Was natürlich nicht ganz billig war ...)

Opus 5 hat diskutiert, wenn man etwas geändert haben wollte. Seine Erklärungen brauchten Erklärungen. Aus einfachen Aufgaben wurden Projekte, und es hat einfach viele Fehler gemacht.

Und Gott, war der Schreibstil schlecht...

Damit waren wir nicht allein. Viele Power-User sind in den letzten Monaten zu ChatGPT Work / Codex gewechselt.

Und jetzt liest man überall auf X: Die kommen zurück!

Was Anthropic verspricht:

  • Fable-Niveau bei den meisten Aufgaben

  • 40 Prozent günstiger im Alltag als Opus 5 und 30 Prozent schneller

  • Schreibt klarer - das Wichtigste zuerst, weniger Jargon

  • Höhere Limits für Pro, Max und Team

Schon nach wenigen Stunden Arbeit damit können wir das bestätigen. Es ist schneller, klarer, smarter und verbraucht wenig vom Limit.

Klar, auch die ersten nervigen Sachen fallen auf:

  • Es kennt kein Ende. Gibst du ihm keine Grenze, baut es und baut es und baut es … obwohl es zwischendurch vielleicht mal gut wäre, zu fragen, ob die Richtung noch passt.

  • Trotzdem noch Prosa. Die Texte lesen sich super, aber die Kernelemente sind immer noch eingepackt in einiges an Prosa davor und danach.

  • Grün muss nicht immer stimmen. Wir lassen die AI ja immer selbst alles überprüfen, was sie gebaut hat. Obwohl versichert wird, dass alles getestet ist, sehen wir trotzdem oft noch Fehler.

Lösungsansätze dafür findest du weiter unten.

GPT-6 Sol und Luna: halber Preis

OpenAI hat Anfang des Monats schon GPT-6 Astra rausgebracht, das große Modell. Unglaublich stark bei Computer Use. So smart. Aber so, so tokenhungrig und teuer.

Sol und Luna sind jetzt die schnellen, günstigen Geschwister.

  • Sol für komplexe Arbeit, Coding und Agents. In einem Benchmark für Business-Workflows schlägt es laut OpenAI das alte Opus 5, für 9 Prozent der Kosten.

  • Luna für Masse. Automationen, einfache Aufgaben, alles, was oft laufen muss.

  • Beide kosten die Hälfte ihrer Vorgänger und antworten kürzer und klarer.

Verfügbar in ChatGPT Work und Codex für alle zahlenden Nutzer.

Kleiner Haken: OpenAI vergleicht Sol mit dem alten Opus 5, Anthropic Opus 5.5 mit dem alten GPT-5.6 Sol.

Einen echten Vergleich Opus 5.5 gegen GPT-6 Sol liefert keiner der beiden. Klar. 😁 Dafür sind auch wir da. Wir tun uns aber aktuell noch etwas schwer, weil Sol 6 und Opus 5.5 wirklich beide sehr stark sind und man oft bei Alltagsaufgaben keinen Unterschied merkt.

Was wir wofür nehmen würden

Stand heute, nach unseren ersten Tests und dem, was wir so lesen:

  • Opus 5.5, wo du eine AI willst, die mitdenkt. Pläne, Analysen mit Meinung, Prototypen, Designs, lange Agenten-Läufe.

  • GPT-6 Sol, wenn es eine Deadline gibt, du einen strengen Lektor brauchst oder es günstig laufen soll. Texte finden wir hier auch noch einen Tick besser.

  • Fable und Astra nur noch für die wirklich harten Brocken.

Unser Take: Du kannst nicht das “falsche” Modell nutzen

Wir sind sehr froh, dass Anthropic wieder aufgeschlossen hat. OpenAI baut nach wie vor die beste User Experience. Die letzten Wochen hatte OpenAI auch klar die besseren Modelle.

Jetzt dreht es sich langsam wieder, und Claude ist sowas von back. Das Schöne: Egal, womit du gerade arbeitest, beides ist top!

🛠️ 4 Regeln, mit denen du das Meiste aus den neuen Modellen holst

Neues Modell heißt leider oft: Alte Prompts, Instruktionen und Skills müssen einmal kurz angeschaut werden.

Im August haben wir die Prüf- und Denk-Anweisungen rausgeworfen, letzte Woche ging es um maximal drei Regeln pro Prompt.

Anthropic und OpenAI haben diesen Monat beide einen Guide für ihre neuen Modelle rausgebracht. Und das Gute für uns: Die sagen fast dasselbe.

Die Modelle arbeiten länger allein, denken von selbst, prüfen von selbst.

Du musst ihnen nicht mehr erklären, wie sie arbeiten sollen.

Sondern wann sie fertig sind. Und wann sie aufhören sollen.

1. Sag, wie "fertig" aussieht

Die ganze Aufgabe in eine Nachricht. Dazu die Ziellinie. Dann laufen lassen.

Mach aus den drei Excel-Listen eine Kundenliste. Fertig heißt: eine Datei, keine Dubletten, jede Firma mit Ansprechpartner und letztem Kontakt. Frag mich nur, wenn sich zwei Einträge widersprechen.

Und "Denk gründlich nach" kannst du jetzt endgültig aus deinen Prompts rausnehmen. Opus 5.5 denkt vor jeder Antwort von selbst. Laut Anthropic kommt die Antwort ohne die Zeile schneller. Und nicht schlechter.

2. Sag, wann es aufhören soll

Die neuen Modelle, allen voran Opus 5.5, laufen und laufen. Super bei großen Aufgaben. Teuer, wenn du eigentlich nur eine schnelle Antwort wolltest.

Anthropic empfiehlt dafür eine Stopp-Regel, einmal in die CLAUDE.md zu packen (bei ChatGPT Work / Codex in die AGENTS.md). Hier unsere deutsche Version:

Wenn ein Schritt meinen Input nicht braucht, mach weiter. Frag nur, wenn du ohne mich nicht weiterkommst oder bevor du etwas tust, das sich nicht rückgängig machen lässt: Daten löschen, etwas verschicken, etwas außerhalb dieses Projekts ändern.

Und wenn es schnell gehen muss, sag im Prompt, was zuerst kommt: "Zuerst den Zeitplan. Alles andere nur, wenn danach noch Zeit ist."

Wichtig: Freigaben für kritische Aktionen trotzdem aktiv lassen. Die Regel ersetzt nicht den Sicherheitsgurt.

3. Sag konkret, was du nicht willst

"Mach es nicht so generisch" bringt laut Anthropic fast nichts. Das Modell tauscht nur einen Standard gegen den nächsten.

Was wirkt, ist eine Liste. Für Designs schlägt Anthropic zum Beispiel vor:

Kein cremefarbener Hintergrund, keine kursiven Akzentwörter in Überschriften, keine "01 / 02 / 03"-Labels, keine runden Pill-Buttons.

Wenn du in den letzten Monaten eine Landingpage mit Claude gebaut hast, kennst du jeden einzelnen Punkt. 😉

OpenAI macht dasselbe für Texte und hat sogar eine Liste an Slop-Wörtern veröffentlicht. "Delve into", "it's worth noting", Kontrast-Floskeln wie "nicht X, sondern Y".

Unser Tipp: Führ deine eigene Liste. Jedes Mal, wenn dich etwas nervt, kommt es drauf.

4. Schick deine Skills durch den TÜV

Das ist der Punkt, den die meisten vergessen. Deine Skills und Anleitungen sind für alte Modelle geschrieben. Für die neuen sind sie oft zu eng, zu lang oder widersprechen sich.

In Claude Code gibt es dafür jetzt einen Befehl: /skill-doctor. Er zeigt dir, welche Skills du wirklich nutzt, welche nie und was jeder davon an Kontext kostet.

Wir haben ihn gestern bei uns laufen lassen.

36 Skills geladen. 11 davon laut Report ewig nicht genutzt. Einer doppelt installiert.

(Falls du nur "Unknown command" siehst: Claude Code einmal updaten.)

Für den Inhalt deiner Skills empfiehlt OpenAI etwas Schlaues: Lass das Modell selbst aufräumen.

Lies meine CLAUDE.md bzw. AGENTS.md und alle Skills in diesem Ordner. Markiere jede Anweisung, die für ein aktuelles Modell überflüssig, widersprüchlich oder zu eng ist, zum Beispiel "denk Schritt für Schritt", "prüf deine Arbeit" oder vage Auslöser in der Beschreibung. Zitier jede Stelle und schlag eine kürzere Fassung vor. Ändere noch nichts.

Funktioniert genauso in ChatGPT Work / Codex.

Unser Take: Sag klar, was “fertig” bedeutet

Früher haben wir der AI erklärt, wie sie arbeiten soll. Schritt für Schritt.

Jetzt beschreiben wir, wie genau "fertig" aussieht, und lassen sie loslaufen.

Das klingt nach einer Kleinigkeit, aber es ist ein ganz anderes Arbeiten. Weniger Chef, der jeden Handgriff vorgibt. Mehr Chef, der sagt, was am Ende rauskommen soll, gelegentlich die Richtung justiert und sagt, wann Feierabend ist.

Fairerweise: Nicht jede Regel gilt für jedes Modell. Kleinere Modelle wie GPT-6 Luna brauchen laut OpenAI teils noch mehr Guidance.

Das ist ja meistens so. Je mächtiger das Modell, desto weniger Führung.

🚗 Agents überall: Warum dein Kontext dir gehören muss

Zum Abschluss ein Thema, das wieder einmal zu den Modellwechseln oben passt.

Das Rennen um die AI und deinen AI-Agenten ist noch nicht entschieden. Wird es wahrscheinlich auch nicht so schnell sein ...

Dazu passt: Seit Dienstag kann Grok (die AI von SpaceXAI) im Tesla deine Mails verwalten, deinen Kalender aufräumen und deine Dateien durchgehen. Per Stimme, während du fährst.

Mit Grok Bot, dem Agenten von SpaceXAI, geht natürlich noch mehr: deinen üblichen Kaffee bestellen, einen Tisch reservieren, einen Termin machen.

Aktuell nur in den USA und nur mit dem großen SuperGrok-Heavy-Abo für 300 Dollar im Monat. Aber die Richtung ist klar.

Grok Bot haben wir im August ausführlich getestet. Jetzt sitzt er mit im Auto.

Das Rennen um deinen persönlichen Agenten

Und Grok ist nicht allein. Innerhalb weniger Wochen kamen:

Die Agents ziehen raus aus dem Laptop. Ins Handy, in WhatsApp, ins Auto.

Bei uns ist es längst so, dass wir nicht einen Agenten haben, sondern mehrere. Instinct und Muse für Privates, Claude Code und ChatGPT Work / Codex für die komplexe Arbeit, Grok Bot zum Experimentieren.

Und ehrlich: Wir halten es gerade für unwahrscheinlich, dass eine einzige Firma jemals alles abdeckt.

Der Agent ist austauschbar. Dein Kontext nicht.

Axios hat es diese Woche gut auf den Punkt gebracht: Der Kampf um deinen persönlichen Agenten ist auch ein Kampf darum, wer deine persönlichen Daten verwaltet.

Je mehr ein Agent über dich weiß, desto besser wird er. Und desto schwerer kommst du wieder weg.

Genau deshalb predigen wir seit gefühlt JAHREN: Files-over-Tools.

Dein Kontext gehört in einfache Textdateien. Wer du bist, woran du arbeitest, mit wem, was dir wichtig ist. In Ordnern, an einem Ort, der dir gehört.

Dann ist jeder neue Agent in Minuten angeschlossen und kennt sich sofort aus.

Unser eigener Beweis diese Woche: Als Opus 5.5 am Dienstag kam, lief unser Second Brain am selben Abend darauf weiter.

Kein Export, keine Migration. Codex liest denselben Ordner. Und wenn morgen ein besserer Agent kommt, liest er ihn auch.

Mehrere Agents gleichzeitig auf demselben Kontext. Das geht nur, wenn der Kontext nicht in einem Tool eingesperrt ist.

Unser Take: Dein Kontext gehört dir

Die Modelle wechseln gerade alle paar Wochen. Die Agents auch.

Wer seinen Kontext in einem einzigen Tool aufbaut, fängt bei jedem Wechsel von vorne an. Wer ihn selbst besitzt, steckt einfach um.

Der Agent ist gemietet. Der Kontext gehört dir.

Genau darum geht es in unserem AI Second Brain Training, an dem wir gerade bauen. Wie du dein eigenes Brain aufsetzt, wie es sich von selbst befüllt und wie jeder Agent damit arbeiten kann.

Noch dieses Jahr geht es los. Wenn du als Erstes Bescheid wissen willst, trag dich auf die Warteliste ein. Wir melden uns, sobald es startet.

So, das war's für heute. Tausend Dank wie immer!

Wir lesen uns!

Reto & Fabian von den AInauten

Du willst tiefer einsteigen? Die AInauten Community.

Der Newsletter hält dich auf dem Laufenden. Die Community ist der Ort für alle, die es selbst umsetzen wollen: Praxisvideos, Deep Dives mit Setup-Anleitung, 50+ Use Cases, alle Trainings (AI Mitarbeiter Bootcamp, Zapier, Make, n8n, Vibe Coding, Claude Code), Austausch mit 900+ Mitgliedern und unsere Hilfe im Feed. 12 Monate, kein Abo. Hier mehr erfahren »