Moin AInauten,

Willkommen zur neuen, heute vielleicht etwas fortgeschritteneren Ausgabe deines Lieblingsnewsletters.

Es geht dabei ums Geld. Genauer: Was kosten die AI-Modelle eigentlich, und wie schützen wir unsere Limits, wenn sie immer weiter runtergefahren werden?

Wir haben verschiedenen Modellen 100-mal dieselben Aufgaben gegeben und dabei gemerkt, wie verschwenderisch wir selbst zum Teil unterwegs sind.

Dazu startet unsere kleine Serie zu Buchhaltung mit AI. Und Europa meldet sich mit gleich zwei neuen Modellen zurück.

Hier die Themen im Detail:

  • 🎚️ Kosten, Geld und Limits bei AI (und warum das wichtig ist)

  • 🧾 Buchhaltungstools & AI? Teil 1 unserer Serie

  • 🇪🇺 Europa meldet sich zurück: Mistral Large 4 & Kolibri

Los geht's!

Diese Ausgabe wird dir präsentiert von:

🎚️ Kosten, Geld und Limits bei AI (und warum das wichtig ist)

Wir schreiben ja viel über die unterschiedlichen AI-Modelle. Zum Teil ist es verwirrend, wenn man sich nicht den ganzen Tag in der AI-Bubble bewegt.

Es gibt unterschiedliche Anbieter, die wiederum haben unterschiedliche Modelle, die wiederum kann man unterschiedlich hart arbeiten lassen.

Und alles kostet dann unterschiedlich. Verwirrung garantiert.

Wir sehen aber, wie das Thema Kosten und Limits mehr und mehr eine Rolle spielt.

So wie du und wir heute AI nutzen, ist es in der Regel extrem stark subventioniert. Es sind nicht die echten Kosten.

Wir glauben deshalb, dass die Subventionen irgendwann enden werden. Daher ist es wichtig, die unterschiedlichen Ebenen zu verstehen. Deshalb geht es heute genau um dieses Thema.

Am Montag ging es um das richtige Modell für den richtigen Schritt. Heute um den zweiten Regler, den viele nicht auf dem Schirm haben: Effort.

Wir fahren fast alles auf Extra High. Bei Claude Opus 5.5 als Standard. Und für die schnellen Quickies zwischendurch Sonnet 5.5. Auch auf Extra High. 😉

Bei ChatGPT ist es GPT-6.1 Sol, auch auf der Stufe High oder Extra High.

Fühlt sich gründlich an. Ist es auch. Aber es ist teuer.

Billig ist nicht billig

Vor zwei Wochen haben wir geschrieben: GPT-6 Sol nimmst du, wenn es günstig laufen soll, im Vergleich zu z. B. Claude Opus 5.5.

Pro Token stimmt das. Aber Tokens sind oft ein abstrakter Vergleich. Die Aussage “billige Tokens bedeuten preiswerte Ergebnisse” kann stimmen - oft ist aber genau das Gegenteil der Fall.

Forscher aus Stanford und Berkeley haben nachgerechnet: In jedem dritten Vergleich war das billiger gelistete Modell am Ende teurer.

SemiAnalysis hat diese Woche gemessen, wie viel Arbeit du für dein Abo bekommst.

Nehmen wir als Beispiel die mittleren Modelle: Für 100 Dollar im Monat gibt es bei Claude API-Tokens für Opus 5.5 im Gegenwert von 5.725 Dollar. Bei ChatGPT sind es 1.055 Dollar für GPT-6.1 Sol.

Jetzt könnte man eine Milchbuchrechnung machen und sagen: “Ok, ich kriege also bei Claude rund 5-mal mehr als bei ChatGPT.” Aber auch das ist nicht korrekt, weil die API-Preise von Anthropic und OpenAI unterschiedlich sind.

Opus 5.5 kostet pro Million Tokens 4 Dollar für die Eingabe und 20 Dollar für die Ausgabe, GPT-6.1 Sol nur 2 beziehungsweise 10 Dollar. Derselbe Tokenverbrauch ergibt bei Claude also schon den doppelten API-Gegenwert, ohne dass du dafür mehr Arbeit bekommst.

Jetzt halbiert OpenAI aber noch die Limits für das 200-Dollar-Abo (hatten wir letzte Woche im P.S.).

Dazu kommt: Jedes Modell denkt für dieselbe Aufgabe unterschiedlich lang.

Bedeutet unter dem Strich: der Preis pro Token lässt sich nicht pauschal auf den Preis pro Aufgabe hochrechnen, weil jedes Modell unterschiedlich viele Tokens dafür braucht.

Wir haben es getestet. 100-mal.

Das waren die Tokenkosten der verschiedenen Modelle. Um die Komplexität noch zu erhöhen, gibt es ja auch noch die Effort-Einstellungen.

Wir wollen dich aber nicht verwirren, sondern hilfreiche Praxistipps liefern, wie du am meisten aus deinem Abo rausholst. Deshalb haben wir verschiedenen Modellen auf verschiedenen Effort-Stufen dieselben Aufgaben gegeben.

  • Eine Kunden-Mail freundlicher machen.

  • Eine Spesenabrechnung mit 30 Belegen prüfen.

Mit eingebauten Fallen: doppelte Belegnummer, Taxi am Sonntag, ein Hotel in Schweizer Franken. Und eine Druckerei-Rechnung, bei der die Summe stimmt, aber die Mehrwertsteuer nicht.

Was rauskam (das ist spannend):

  • Dieselbe Mail kostet auf Max-Effort 25-mal so viel wie auf Low. 14.698 statt 435 Tokens, fast zwei Minuten statt 7 Sekunden. Das Ergebnis? Praktisch identisch.

  • Opus 5.5 löst die Spesenprüfung schon auf Low fehlerfrei. Max kostet das 7,6-Fache. Besser wird nichts.

  • Gemini 3.8 Flash ist pro Token 62 % billiger als GPT-6.1 Sol. Pro Aufgabe ist es 73 % teurer. Es denkt einfach fünfmal so lang 😁.

  • Das kleine GPT-6 Luna fällt auf Low und Medium durch. Die Druckerei-Falle übersieht es jedes Mal. Auf Extra High: 3 von 3 richtig. Für 0,27 Cent. Das ist 28-mal billiger als Opus auf Low.

So haben wir getestet: über die API (via OpenRouter), immer dieselbe Aufgabe, nur Modell und Effort verändert. Kleine Stichprobe, 2–3 Läufe pro Stufe. In den Apps hast du je nach Abo weniger Auswahl. Luna samt Effort-Stufen gibt es zum Beispiel in ChatGPT Work und Codex. Und im Abo zählt nicht der Dollarbetrag, sondern wie schnell deine Verbrauchsanzeige steigt.

Zwei Regler, die du kennen musst

Genug Zahlen. Wie holen wir jetzt mehr aus unserem Abo raus?

1. Das Modell

Such dir pro Aufgabe eins aus und bleib dabei. Jedes Modell hat seinen eigenen Zwischenspeicher (Token-Cache). Wechselst du mitten im Chat, liest das neue Modell den ganzen Verlauf noch mal ein. Zum vollen Preis!

Zwischen zwei Schritten wechseln, wie am Montag beschrieben: okay. Mittendrin: lieber nicht. Beispiel: du hast einen Plan mit dem besten Modell erstellt, für die Umsetzung wechselst du dann zu einem mittleren Modell.

(Wir arbeiten noch an einem Deep-Dive zum Thema „Welches Modell wann nutzen …“)

2. Der Effort

Bei Claude im Modellmenü neben dem Senden-Knopf (im deutschen Menü heißt er „Aufwand“). Bei ChatGPT heißt er Thinking und geht von Instant bis Pro (oder Ultra, das musst du in den Einstellungen aber zuerst aktivieren).

Wichtig: Effort regelt nicht, wie schlau das Modell ist. Sondern wie gründlich es prüft.

Mit dem Effort gibst du dem Modell also mehr Zeit zum Nachdenken. Damit fängst du versteckte Sonderfälle. Aber nur, wenn es welche gibt.

  • Low: Mails, Übersetzen, Umformulieren, Ideen sammeln. Alles, was du sofort selbst siehst.

  • Medium: der Standard für den Rest.

  • High oder Extra High: wenn Fehler teuer sind und nicht sofort auffallen. Verträge, Zahlen, Abrechnungen.

  • Max: nur, wenn die AI lange ganz allein laufen soll.

Bei kniffligen Aufgaben kann das den Unterschied machen. Für eine freundlichere Mail dauert es oft einfach nur länger. Die Faustregel aus unserem Test: Starkes Modell, Effort runter. Kleines Modell, Effort rauf.

Unser Take: Finde den “Sweet Spot” für deine Aufgaben

Es ist ein komplexes Thema, das wir aber alle beherrschen müssen. Insbesondere weil die Labs jetzt damit beginnen, die Subventionen runterzufahren.

Für unsere langen Agenten-Läufe in Claude Code darf es bei Extra High bleiben. Da schaut keiner zwischendurch drauf. Genau dafür ist es da.

Aber bei den Quickies verbrennen wir Limit. Sonnet auf Extra High kostet für eine Mail so viel wie Opus auf Low. Und 2,5-mal so viel wie Sonnet auf Low. Gleiches Ergebnis. Wir gehen somit auf Low.

Also, bedeutet für dich: Spiele mehr mit den Effort-Einstellungen. Es wird sich lohnen.

Es gibt übrigens noch einen ganzen Haufen weiterer Hebel. Alte Chats, Screenshots, Projekte, Connectors. Diese Details packen wir dann in einen eigenen Deep-Dive.

Anzeige | Mit unserem Partner sevdesk

🧾 Buchhaltungstools & AI?

Letzte Woche haben wir darüber geschrieben, welche Tools wir gerade kündigen. Gamma war das jüngste.

Auf unserer Liste „Bleibt“ stand aber auch was: Buchhaltung. Da dockt der Agent an. Er ersetzt das Tool nicht.

Das Thema Buchhaltung und AI ist gerade bei Solopreneuren und Selbstständigen ein Dauerbrenner in unserer Community.

Daher starten wir heute eine kleine Serie zum Thema und zeigen dir, wie das bei einer kleinen Firma von uns ganz konkret aussieht. In 3 Teilen.

Zusammen mit unserem heutigen Partner sevdesk, das wir seit Anfang des Jahres selbst für genau diese Firma nutzen.

Keine Sorge, der erste Teil ist vielleicht schon etwas fortgeschritten, die folgenden werden simpler.

Unser Buchungslauf von letzter Woche

Ende September. 28 Belege im Eingangsordner in unserem Google Drive. Software-Abos, Telekom, Parkhaus, Öffi-Tickets. Das Übliche.

Für den ersten Buchungslauf haben wir schon länger einen Skill. Wir tippen /belege-buchen. Fertig.

Wir haben dazu unseren sevdesk-Account über die sevdesk-API mit Claude verbunden. (Darüber haben wir hier schon einmal geschrieben.)

Claude liest jeden Beleg, legt ihn in sevdesk an, wählt Konto und Steuerregel und gleicht mit der Bank ab.

Das Ergebnis:

  • 8 gebucht. Mit Konto, Steuer und Zahlung.

  • 3 Dubletten erkannt. Rechnungen, die schon gebucht waren und nochmal im Ordner lagen. Aussortiert.

  • 17 bewusst liegen gelassen.

Warum 17 liegen geblieben sind

Alles Fremdwährung. API-Credits, Domains, Tools aus den USA.

In unserem Handbuch für Claude steht eine Regel: Niemals selbst umrechnen. Gebucht wird erst, wenn der echte Euro-Betrag von der Kreditkarte da ist.

Ein Modell, das „einfach mal“ mit dem Tageskurs umrechnet, produziert Buchungen, die plausibel aussehen. Und trotzdem falsch sind. Merkt keiner. Bis der Steuerberater fragt.

Was außerdem immer super hilfreich ist, sind die Auffälligkeiten und Probleme, die uns die AI meldet:

So sehen wir schnell, wenn irgendwelche Belege nicht passen.

Die Leitplanken kommen vom Tool

Jetzt aber zum wichtigen Teil: warum wir sevdesk nicht kündigen, obwohl Claude in der Theorie selbst buchen kann.

sevdesk gibt Claude einen Rahmen vor, über den Claude nicht hinauskommt.

  • Claude kann sich keine Buchungen ausdenken. Über die API laufen nur Belege auf gültige Konten. Freie Buchungssätze gibt es nicht. Nervt manchmal. Ist aber richtig so.

  • Was gebucht ist, ist fest. Ändern geht nur über einen bewussten Schritt zurück in den Entwurf. Nichts wird nebenbei überschrieben.

  • Die Umsatzsteuer-Voranmeldung und das finale Absenden bleiben bei dir und deinem Steuerberater. Das läuft über die Oberfläche, nicht über Claude. Der Steuerberater kann dann in DATEV auch noch einmal alles korrigieren, was nicht passt.

AI ist super im Lesen, Zuordnen und Finden von Auffälligkeiten. Ein genialer Coach. Aber bei Buchhaltung willst du nicht, dass sie sich die Regeln selbst schreibt und macht, was sie für richtig hält.

Die Regeln liefert das Tool. Claude bedient es nur.

Brauchst du dafür überhaupt AI?

Ehrlich: Die meisten nicht.

Wir spielen gerne mit AI und schauen immer, was möglich ist.

sevdesk hat selbst AI eingebaut.

Belege werden automatisch ausgelesen. Und wenn dein Bankkonto verknüpft ist, werden Zahlungseingänge automatisch verbucht.

Für Solo-Selbstständige und frische Gründer reicht das oft komplett.

Claude ist die Kür. Für alle AI Power-User, die Sonderfälle, Auswertungen und Berichte wollen. Wie das Setup funktioniert, haben wir hier Schritt für Schritt gezeigt.

Bei uns schaut immer noch einmal ein Mensch drüber. Claude erledigt nur die Vorarbeit. Und am Ende natürlich noch einmal der Steuerberater.

So startest du

  • Kostenlos: dauerhaft 0 €, bis zu 3 Rechnungen pro Monat, auch als E-Rechnung. Zum Reinschnuppern ohne Risiko.

  • Mit API für Claude: Tarif Buchhaltung Pro. Mit AINAUTEN60 sparst du 60 % bei 12 oder 24 Monaten Laufzeit. Lieber monatlich? Dann AINAUTEN3M für 60 % auf die ersten 3 Monate.

P.S. Nächsten Monat in Teil 2: ein Prompt, mit dem Claude nur liest, nichts anfasst und dir in fünf Minuten erklärt, wo dein Unternehmen gerade steht.

🇪🇺 Europa meldet sich zurück: Mistral Large 4 & Kolibri

Zum Abschluss eine kurze, aber wichtige News aus Europa.

Im August haben wir noch darüber geschrieben, ob Europa im Rennen um ein eigenes Spitzenmodell aufgibt.

Mistral hatte damals plötzlich ein chinesisches Modell auf die eigene Plattform gestellt. Viele sind davon ausgegangen, dass sie aufgeben.

Diese Woche kam die Antwort. Gleich doppelt!

Mistral Large 4. Spitzname: Le Chonk. 😉 1 Billion Parameter, komplett in Europa trainiert und betrieben.

Per API ab sofort, die Weights zum Selbst-Hosten sollen Ende Oktober kommen.

Laut Mistral das beste offene Modell aus den USA oder Europa. Nach den Zahlen von Artificial Analysis stimmt das auch.

Fairerweise: Im Ranking von Artificial Analysis liegt es mit 38 Punkten hinter sieben offenen Modellen aus China zurück.

Und 20 Punkte hinter Opus 5.5. Also ungefähr auf dem Niveau von GPT-6 Luna. Ja, dem kleinen Luna von oben.

Trotzdem. Ein gutes offenes Modell aus Europa zu haben, finden wir WICHTIG!!!

Zweite News, die wir selbst noch nicht abschließend einordnen können.

Kolibri-1 von Aleph Alpha.

Ja, Aleph Alpha, das einstige Hype-Lab aus Deutschland, das viele totgesagt haben, meldet sich mit einem Modell zurück.

Es ist das erste neue Modell aus Heidelberg seit August 2024. Es ist klein (3,5 Milliarden aktive Parameter), kann Deutsch und Englisch und ist frei nutzbar unter Apache 2.0.

Gedacht ist es für Behörden und Industrie, nicht für den Spitzenplatz. Benchmarks gibt es bisher nur vom Hersteller.

Wir wollten darüber schreiben, weil wir so selten News aus Deutschland haben. Aber vom Hocker haut uns das jetzt auch nicht.

Kleine Ironie am Rande: Teile der Trainingsdaten stammen laut heise aus chinesischen Modellen. 😉

Unser Take: Totgesagte leben länger

Europa ist nicht raus. Vorne mit dabei aber auch nicht.

Für die meisten Firmen hier zählt aber eh was anderes als der Platz im Ranking. Wo läuft das Modell? Darf ich es selbst betreiben? Und reicht es für meine Aufgabe?

Unser Test von oben zeigt: Ein Modell auf Luna-Niveau kann reichen - wenn du den Effort hochdrehst. (Disclaimer: Mistral und Kolibri haben wir selbst noch nicht getestet.)

Geschafft! Ist wieder etwas länger geworden. Auch etwas komplexere Themen als sonst. Hätten wir wohl auf Low schreiben sollen. 😉

Bis nächste Woche!

Reto & Fabian von den AInauten

Du willst tiefer einsteigen? Die AInauten Community.

Der Newsletter hält dich auf dem Laufenden. Die Community ist der Ort für alle, die es selbst umsetzen wollen: Praxisvideos, Deep Dives mit Setup-Anleitung, 50+ Use Cases, alle Trainings, Austausch mit 1000+ Mitgliedern und unsere persönliche Hilfe. 12 Monate, kein Abo. Hier mehr erfahren »