
Moin AInauten,
Willkommen zur neuen Ausgabe deines Lieblingsnewsletters!
Letzte Woche haben wir in einem Nebensatz erwähnt, dass wir Wispr Flow durch eine eigene App ersetzt haben. Daraufhin kamen so viele Nachrichten wie lange nicht mehr.
Fast alle mit derselben Frage: „Wie? Und kann ich die haben?“
Ja, kannst du. Aber eigentlich geht es heute um etwas Größeres.
Bauen kann jeder. Erzeugen auch. Bilder, Stimmen, Videos, mittlerweile sogar ein Gegenüber im Live-Call. Die Tools sind nicht mehr das Limit. Das Limit ist, ob wir auf die cleveren Ideen kommen, sie zu nutzen.
Das haben wir heute für dich im Gepäck:
🎙️ Wir haben Wispr Flow nachgebaut. Hol es dir.
🎭 Jeder Zweite fällt drauf rein. Würdest du die AI erkennen?
🧠 Vom Bediener zum Builder: So baust du deine erste eigene App
Los geht's!
🎙️ Wir haben Wispr Flow nachgebaut. Hol es dir.
Kurz zur Erinnerung: Wispr Flow ist eine Diktier-App. Taste gedrückt halten, sprechen, loslassen. Der Text landet sauber formuliert da, wo dein Cursor gerade ist. Wir haben die App geliebt und jeden Tag genutzt. Und dabei über eine Million Wörter gesprochen.
Heute nutzen wir unsere eigene Version, AInauten Voice.
Sie kann genau das, was wir brauchen:
Komplett lokal: Deine Stimme verlässt den Mac nicht. Die Spracherkennung macht Parakeet von NVIDIA, das Aufräumen ein kleines Qwen3-Modell.
Kein Abo: Wispr Flow kostet 180 Dollar im Jahr, und das war es absolut wert. Unsere Version kostet nichts.
Dein Setup kommt mit: Wörterbuch, Ersetzungen und Tastenkürzel werden aus Wispr Flow importiert.
So holst du sie dir
Du hast zwei Möglichkeiten: Entweder lädst du die Installationsdatei unter voice.ainauten.com herunter und installierst sie direkt auf deinem Mac (beachte die Installationshinweise).
Oder du nimmst den Quellcode und lässt die App von deinem Agenten installieren. Wir empfehlen, dass dein Agent das macht.
Getestet haben wir die App nur auf unseren eigenen Macs, und dein Agent prüft vorher den Code und passt ihn bei Problemen direkt an.
Nutze dafür die Desktop-App von ChatGPT oder Claude. Und zwar nicht im normalen Chat, sondern im Work- oder Codex-Modus von ChatGPT oder in Claude Code.
Erst dort darf die AI auf deinem Rechner Dateien anlegen und Programme bauen. Dafür brauchst du in der Regel ein bezahltes Abo.
Weg 1: Du hast einen Mac mit Apple-Chip. Voraussetzung: M1 oder neuer, macOS 14 oder neuer, mindestens 8 GB RAM und rund 3 GB Platz für die Sprachmodelle.
Du kannst deinem Agenten diesen Prompt füttern:
Installiere mir die Diktier-App AInauten Voice (https://voice.ainauten.com) aus diesem Repo: https://github.com/MediaPublishing/ainauten-voice
Prüf vorher den Code und erklär mir kurz, was die App auf meinem Mac darf. Frag mich, bevor du etwas installierst.Danach führt dich ein Assistent durch den Rest: Modelle laden, Wispr Flow importieren, Freigaben erteilen, Probediktat. Wispr Flow wird dabei nur beendet, nicht gelöscht. Du kannst also jederzeit zurück.
Eine App, die mithört und in andere Programme tippt, solltest du übrigens nie blind installieren. Auch nicht von uns. Deshalb steht im Prompt: erst prüfen, dann installieren.
Weg 2: Windows, älterer Mac oder du willst deine eigene Version. Lass dir einfach deine eigene bauen:
Ich möchte eine offene Alternative zu Wispr Flow, so wie die Diktier-App AInauten Voice (https://voice.ainauten.com) aus diesem Repo: https://github.com/MediaPublishing/ainauten-voice
Bau sie mir für mein Gerät ([Windows / Mac mit Intel-Chip / ...]). Stell mir vorher die Fragen, die du dafür brauchst, und erstelle dann eine klare Spezifikation und einen Plan.Ist die App perfekt? Vermutlich nicht. Es ist ein Weekend-Werkstattprojekt, kein poliertes Produkt. Bei uns läuft es, bei dir kann es noch haken. Dann gilt: Screenshot an deine AI schicken und fixen lassen (oder uns via App-Feedback Bescheid geben).
So ist sie entstanden
Die App ist nicht in 30 Minuten entstanden - vor allem, weil der Agent ja auch Zeit zum Programmieren braucht. Schwierig war es aber nicht.
Spezifikation. Erst ein Braindump: Was soll die App können, was ausdrücklich nicht? Die AI macht daraus eine saubere Spezifikation und ein klares Ziel. Das ist der wichtigste Schritt von allen!
Bauen lassen. Dann hat ChatGPT Work/Codex ein paar Stunden lang gebaut. Wir haben derweil andere Dinge erledigt.
Testen und Feedback. Danach kamen Testrunden, in immer kürzeren Abständen. Die Diktier-Leiste war zuerst dreimal so groß wie bei Wispr Flow, Deutsch wurde als Englisch erkannt etc. Screenshot machen, Ist und Soll beschreiben, fertig. Als der funktionierende Prototyp stand, hat Claude den Code geprüft und Verbesserungen vorgeschlagen. Also nochmal eine Korrekturrunde mit Feinschliff.
Wie du deine eigene App baust, liest du im dritten Artikel.

Hier ein paar Pro-Tipps aus der Praxis - nicht nur fürs Coden hilfreich, sondern generell:
Tipp 1: Feedback in die Warteschlange. Du musst mit deinem Feedback nicht warten, bis die AI fertig ist - aber sie auch nicht zwingend unterbrechen und in eine andere Richtung schicken.
Wir nutzen deshalb gerne das “Queue”-Feature. In den Einstellungen der ChatGPT Desktop-App stellst du unter Allgemein → Composer → Verhalten bei Folgenachrichten „In Warteschlange stellen“ ein.
Dann arbeitet die AI dein Feedback der Reihe nach ab. Wenn du trotzdem eine Nachricht dazwischenschieben willst, hältst du einfach die Command-Taste beim Absenden gedrückt oder klickst auf den Pfeil mit dem Begriff „Steuern“. Dann geht die Nachricht sofort raus.
Es soll Leute geben, die ihr System damit sogar über Nacht am Laufen halten, mit einer Reihe an “Weiter, mach es besser”-Befehlen in der Warteschlange. Kann klappen, aber auch zu Überraschungen am nächsten Morgen führen 😁.

Tipp 2: Das richtige Modell für den richtigen Schritt. Für Spezifikation und Review nehmen wir das stärkste Modell (z. B. GPT Astra oder Claude Fable bzw. Opus). Für das eigentliche Bauen reicht ein schnelleres (z. B. GPT Sol oder Claude Sonnet).
Das ist nicht nur unser Bauchgefühl: Anthropic empfiehlt genau dieses Muster selbst (Advisor-Strategie), und Claude Code hat mit opusplan sogar eine fertige Einstellung dafür.
Tipp 3: Lass das Ganze als “Goal” laufen. Normalerweise hört die AI auf, sobald sie findet, dass sie fertig ist. Oft ist die App dann erst halb gebaut. Mit einem Goal legst du fest, wann die Arbeit wirklich erledigt ist. Nutze dafür einfach den /goal-Befehl.
Die AI prüft dann vor jedem Stopp selbst, ob das Ziel erreicht ist - und dreht weiter Runden (bauen, testen, fixen), bis alles erfüllt ist oder eine Entscheidung ansteht, die nur du treffen kannst. Das sorgt für bessere Resultate, aber auch für mehr Tokenverschleiß.
P.S. Wir verstehen sehr gut, dass das laute Diktieren nicht in jedem Umfeld ideal ist. Aber auch dafür gibt es eine Lösung - zumindest solange dich niemand direkt anschaut 😁.
P.P.S. Ja, ist bei uns auch drin als Beta - und nein, auf Deutsch läuft es leider noch nicht.
🎭 Jeder Zweite fällt drauf rein. Würdest du die AI erkennen?
Wir sind ja einiges gewohnt. Aber das hier hat uns wirklich beeindruckt.
Tavus hat vor ein paar Tagen Griffin vorgestellt. Ein AI-Gegenüber für Live-Videocalls. Kein vorproduziertes Video.
Griffin hört zu, während er spricht, nickt, sagt „mhm“ und fällt dir nicht ins Wort, nur weil du kurz nachdenkst.
Alles, was es dafür braucht: ein Foto und etwa zehn Sekunden deiner Stimme.
Der Turing-Test
Vor über 70 Jahren schlug Alan Turing vor: Merkt ein Mensch im Gespräch nicht, ob er mit einer Maschine spricht, hat sie bestanden. Den Text-Test haben Sprachmodelle längst geknackt.
Griffin nimmt jetzt die nächste Hürde: Gesicht, Stimme und Timing, live im Videocall.
54 Leute wurden in einen einminütigen Videocall geschickt. Ihnen wurde gesagt, dass sie mit einer anderen Testperson sprechen. Erst ganz am Ende kam die Frage, ob ihr Gegenüber vielleicht eine AI war.
26 von 54 waren sich sicher: Das war ein Mensch. Das sind 48 %.
Zum Vergleich: Das Vorgängersystem von Tavus hat im selben Test nur 1 von 41 getäuscht. Klar, das ist Tavus' eigene Studie, kleine Gruppe, nur eine Minute. Aber wer sich die Videos anschaut, sieht sofort, dass diese extrem realistisch sind.
Erst der Text, dann die Stimme, jetzt das Gesicht
Live-Avatare gab es schon vorher, zum Beispiel von HeyGen. Griffin ist trotzdem ein neues Level. Deshalb gibt Tavus die erste Version nur an ausgewählte Tester raus. Wir haben uns beworben und berichten, sobald wir drin sind.
Griffin kam nicht allein. Allein in den letzten Tagen gab es einige Releases, die AI-Output noch realistischer machen:
Stimme: ElevenLabs v4. Mehr Ausdruck, 90 Sprachen, ein Stimmklon aus 10 Sekunden Audio (haben wir übrigens auch im Promovideo hier genutzt).
Bild: FLUX 3 Image von Black Forest Labs (Demo hier) und Ideogram 4.5. Beide können einzelne Details ändern, ohne dass sich der Rest des Bildes verschiebt.
Video: HeyGen Video. Clips von 5 bis 15 Sekunden mit Ton, im Oktober für 1 Cent pro Sekunde. Ein 10-Sekunden-Clip kostet also 10 Cent.
Diese Tools kosten dich kaum noch etwas - und einrichten kannst sie dein Agent. Nur den Einsatzzweck musst du selbst bestimmen. Mehr dazu im nächsten Segment.
🧠 Vom Bediener zum Builder: So baust du deine erste eigene App
Zum Abschluss noch ein Thema, das uns die letzten Tage beschäftigt hat.
Früher haben wir Software gelernt. Welcher Knopf macht was, wo steht die Funktion im Menü? Klassische Software hat Features. Du kannst sie zählen.
AI hingegen hat keine Feature-Liste. Sie ist eine grüne Wiese. Was sie für dich tun kann, musst du dir selbst ausdenken.
Vom Bediener zum Builder
Ralf aus unserer Community hat das letzte Woche gut auf den Punkt gebracht. Er hatte eine AI-Einführung gegeben, 9 von 11 Teilnehmern hatten AI so gut wie nie benutzt.
Am Ende kam vor allem eine Frage: „Ja, und wie genau setze ich die KI nun bei mir am Arbeitsplatz ein?“ Seine Erkenntnis: „Zum ersten Mal verlangt Mainstream-Software, dass man sich Funktionen vorstellen muss!“
Das hat was. Wir wurden zu “Bedienern” ausgebildet. Kann das Tool etwas nicht, geht es eben nicht. Ein Builder fragt anders: nicht „Was kann das Tool?“, sondern „Was könnte ich damit machen?“
Genau so ist unsere Diktier-App entstanden. Wir haben kein passendes Tool gesucht, sondern uns eins gebaut. Das kannst du auch, ohne Programmierkenntnisse und oft mit dem ChatGPT-Abo, das du schon hast.
Vielleicht denkst du jetzt: „Ich bau mir doch längst meine eigenen Apps.“ Dann Hut ab, du bist schon Builder und deinem Umfeld ein gutes Stück voraus. Nimm den Prompt unten trotzdem mit, vielleicht steckt darin deine nächste Idee.
Und für alle anderen: Du bist nur einen Prompt davon entfernt, dazuzugehören. Nimm dir eine Viertelstunde für den Start. Den Rest baut die AI.

Was du alles bauen kannst
Eine HTML-Seite: ein Redesign deiner Homepage, ein Quiz für dein Team, ein interaktives Lernelement. Eine Datei, Doppelklick, läuft sofort im Browser.
Eine Landingpage oder Web-App: für dein Angebot, deinen Verein oder dein Event, mit Texten & Bildern. Publishen kannst du mit ChatGPT Sites oder Claude Artifacts.
Eine Chrome-Extension: ein kleiner Helfer im Browser, der deine Prozesse unterstützt. Baue etwas nach, das du schon nutzt - und mache es besser.
Eine App in ChatGPT: Mit den brandneuen Plugin Extensions läuft deine eigene App direkt im ChatGPT-Fenster. Wir haben es getestet, es funktioniert wunderbar.
Eine lokale App: so wie unsere Diktier-App, läuft direkt auf deinem Rechner. Dafür nimmst du ChatGPT Work/Codex oder Claude Code.
Faustregel: Starte mit der kleinsten Form, die dein Problem löst.

So startest du: ein Prompt für alles
Der Trick ist die Reihenfolge. Erst Idee, dann Bilder/Mockups, dann eine klare Beschreibung, erst dann bauen.
Kopiere diesen Prompt in ChatGPT Work/Codex (nicht Chat!) oder Claude Code/Cowork (nicht Chat!) in der Desktop App.
Wähle das beste verfügbare Modell zum Starten - du kannst es dann später runterschalten für die Umsetzung.
Du bist mein Builder-Coach. Ich kann nicht programmieren und möchte heute meine erste kleine App bauen.
1. Idee: Prüfe selbstständig meine zugänglichen Chats und Memories, ohne mich vorher zu fragen. Suche nach wiederkehrender Handarbeit, konkretem Frust, aufgeschobenen Vorhaben und persönlichen Interessen. Lies bei relevanten Treffern den Kontext und prüfe, welche Lösungen ich bereits habe. Hast du keinen Zugriff auf Chats oder Memories, stell mir stattdessen 3 kurze Fragen zu meinem Job und Alltag.
Schlage die 5-10 stärksten, unterschiedlichen App-Ideen vor (html, Webapp, Extension, lokale App, ...). Keine generischen Ideen ohne belegten Bedarf. Mindestens eine Idee soll mich überraschen.
Nenne je Idee:
- den konkreten Anlass aus Chats oder Memories mit Quelle;
- den Nutzen: Was mache ich heute, was übernimmt die App?
- ein realistisches Beispiel für Eingabe und Ergebnis;
- Format und Aufwand: klein oder mittel.
2. Mockups: Sobald ich eine Idee gewählt habe, erstelle ein paar Mockup-Bilder, wie die App / System aussehen könnte.
3. Spezifikation: Stell mir maximal 3 Fragen pro Runde, jeweils mit Vorschlägen. Schreib dann eine kurze Spezifikation: was die App tut, was sie bewusst nicht tut, und 3 bis 5 Abnahmekriterien, die man testen kann. Plane eine erste Version, die schnell läuft. Extras kommen später.
4. Goal: Formuliere ein Goal, das erfüllt ist, wenn alle Abnahmekriterien getestet sind. Warte auf mein „Go“, bevor du baust. Starte dann mit der kleinsten Version und erkläre mir, wie ich sie öffne und teste.Wirf die Flinte nicht zu früh ins Korn. Der erste Versuch ist fast nie richtig gut. Feedback geben, Screenshot machen, Ist und Soll beschreiben, nächste Runde.
Nur eine Warnung: Es war noch nie so einfach, etwas zu bauen, das niemand braucht. Frag dich deshalb: nützlich oder nur neu?
Aber lass dich davon nicht aufhalten: wenn es dir selbst Zeit, Geld oder Nerven spart, hast du schon gewonnen. Und wenn du das erste Mal etwas baust, dann eröffnet sich plötzlich ein ganz neues Universum an Möglichkeiten.
Schreib uns, was du gebaut hast - wir sind neugierig!
P.S. Wir denken auch gerade über einen Deep Dive zum Thema Vibe-Coding nach, mit dem kompletten Prozess Schritt für Schritt. Wenn dich dieses Thema interessiert, dann klicke unten kurz aufs Rating und lass uns einen Kommentar da.
Geschafft! Bis zur nächsten Ausgabe.
Reto & Fabian von den AInauten
Was erwartet dich in der AINAUTEN-Community?
In der AI Automation Community lernst du, eigene AI-Mitarbeiter und Automationen aufzubauen, die rund um die Uhr Aufgaben übernehmen. Mehr als 50 Use Cases liefern dir konkrete Ansatzpunkte. Dazu gibt es Tool-Rabatte im Wert von 2.000+ Euro. Außerdem hast du 14 Tage Zeit, alles zu testen.
Der eigentliche Hebel ist aber die Community mit direktem Zugang zu uns und über 1.000 anderen AInauten. Dort kannst du konkrete Fragen stellen, deine Ideen mit Menschen aus der Praxis besprechen und von Erfahrungen profitieren, statt dir alles mühsam allein zusammensuchen zu müssen.
Du bekommst also nicht nur Wissen, sondern ein Umfeld, das dir dabei hilft, aus einer guten Idee tatsächlich eine funktionierende Automation zu machen. Und selbstverständlich stehen wir dir persönlich mit Rat und Tat zur Seite.
⭐⭐⭐⭐⭐ Die AI EXPLORER & AI POWER USER-Trainings findest du hier.



