Wie ein KI-Agent in 41 Tagen mein Hörbuch produziert hat

„Blut und Feuer" gibt es jetzt auch als Hörbuch – komplett vertont von einer KI-Stimme und gesteuert von einem KI-Agenten, den ich als Produktionspartner gebaut habe. Am 7. August 2026 stand der erste Commit in einem leeren Repository: eine `CLAUDE.md` mit 57 Zeilen Grundregeln. Am 17. September 2026, 217 Commits später, war das Hörbuch fertig: neun Kapitel, sieben Stunden Spielzeit.
Das ist keine reine Erfolgsgeschichte im Sinne von „alles lief glatt". Neben dem zufriedenstellenden Ergebnis ist es auch ein Protokoll von Fehlern und Kurskorrekturen: Aus anfangs wenigen Regeln wurde über 41 Tage ein Produktionssystem mit vierstufiger Korrektur-Hierarchie und rund 12.000 Zeilen modularem Code, gewachsen an konkreten, teilweise teuren Fehlern. Wie so oft bei diesen Projekten, die mit „ich probiere das mal aus" starten.
Der Ausgangspunkt: Eine KI-Stimme vertont den ganzen Roman
Die Idee: Eine einzige KI-Stimme vertont den kompletten Roman, inklusive aller wörtlichen Rede sämtlicher Figuren. Eine Sprach-API übernimmt die Vertonung, der KI-Agent steuert sie. Zur Spracherzeugung habe ich ElevenLabs verwendet.
Schon am ersten Tag zeigte sich: Ein Kapitel lässt sich nicht am Stück an die API schicken. Der Text muss zuerst in Chunks – kurze, einzeln vertonbare Textabschnitte – zerlegt, mit Emotion-Tags für Tonfall und Betonung versehen und dann in Batches generiert werden.
Kurz darauf kam ein Aussprache-Wörterbuch dazu, weil wiederkehrende Fantasy-Namen ohne feste Aussprache jedes Mal anders klangen. Dieses pronunciation-Dict von ElevenLabs ist sehr hilfreich, verhindert aber immer noch nicht kleine Abweichungen in der Aussprache dieser Wörter.
Warum am Probehören kein Weg vorbeiführte
Jedes generierte Audio musste komplett probegehört werden, weil die KI-Stimme überraschend gelegentlich ganz gewöhnliche Wörter falsch aussprach – aus „kann" wurde einmal „kamm".
Solche Ausrutscher kamen selten vor, aber unvorhersehbar: Es gab keine verlässliche Möglichkeit, sich auf korrekt gesprochene Wörter zu verlassen, ohne nachzuhören. Sieben Stunden fertiges Hörbuch haben deshalb schätzungsweise 14 Stunden Probehören gekostet.
Ein Versuch, falsch gesprochene Wörter automatisiert per Speech-to-Text-Modell zu finden, blieb nur mäßig erfolgreich: Whisper-1 von OpenAI hörte teilweise auch korrekt gesprochene Wörter fälschlich als Fehler heraus. Am manuellen Probehören führte deshalb kein Weg vorbei.
Die teuersten Fehler der Hörbuchproduktion
Der teuerste Fehler fiel erst nach 25 Tagen auf, betraf aber rückwirkend die ersten Kapitel: Jede Aufnahme wurde beim Trimmen, bei Fade-Effekten und beim Zusammenfügen erneut verlustbehaftet als MP3 kodiert – teils sechs- oder siebenmal für dasselbe Stück Audio.
Das Ergebnis: ein Klang, der über viele Bearbeitungsschritte hinweg zunehmend blechern wurde. Die Lösung war naheliegend, aber grundlegend: Rohfassungen im flac-Format bleiben nun bis zur letzten Kodierung verlustfrei erhalten.
Natürlich gab es noch weitere Fehler:
- Ein Trimming-Bug schnitt hörbare Wörter ab, weil die Suchrichtung beim Schnitt falsch herum lief.
- Ein Kontrollhören deckte drei unterschiedliche Ursachen für falsche Aussprache auf – zwei davon waren Tippfehler im Originalmanuskript, keine Bugs in der Vertonung. Wie peinlich ...
- Eine bereits fertige, bezahlte Generierung wurde von Claude gelöscht, weil ein Hintergrundprozess fälschlich als hängengeblieben eingestuft wurde.
- Noch am vorletzten Produktionstag sorgte ein Lautstärke-Bug dafür, dass nachträglich eingefügte Ersatzsätze systematisch zu laut klangen.
Wie der Produktions-Workflow in 41 Tagen gereift ist
Die interessanteste Entwicklung war nicht technisch, sondern prozessual. Ein erstes Checkpoint-System – Freigaben in einer separaten Markdown-Datei – hielt genau einen Tag. Am Tag darauf wurde es durch Live-Probehören direkt im Chat ersetzt, ohne Umweg über eine Zwischendatei.
Genauso iterativ entstand die heutige mehrstufige Korrektur-Hierarchie für fehlerhafte Batches: zuerst nur den Schnittpunkt neu setzen (kostenlos), dann einzelne Sätze neue generieren und patchen.
Ein ganzer Batch wurde nur dann neu generiert, wenn das Patchen eines Satzes nicht funktionierte. Dieser ganze Prozess wuchs über mehrere Tage aus konkreten Fehlern, nicht aus einem Plan.
Vom Monolithen zum modularen System mit GUI
Bis zum 10. September steckte die gesamte Vertonungslogik in einer einzigen Script-Datei mit 2.458 Zeilen. An diesem Tag entstand ein Modularisierungsplan – und wurde noch am selben Tag vollständig umgesetzt: Aus der einen Datei wurde ein schlanker CLI-Einstiegspunkt, die eigentliche Logik wanderte in klar getrennte Module.
Heute stehen dahinter knapp 12.000 Zeilen Code, verteilt auf abgegrenzte Verantwortlichkeiten statt auf eine unüberschaubare Datei. Eine grafische Oberfläche, die mir die Arbeit erleichtert, ist nun ebenfalls dabei.
Überraschende Zahlen zur KI-Hörbuchproduktion
„Blut und Feuer" besteht aus 2.020 Chunks mit rund 57.700 Wörtern Text. Daraus wurden 291 eindeutige Audio-Batches erzeugt – aber 489 Batch-Versionen insgesamt. Fast jeder zweite Batch musste also mindestens einmal korrigiert werden. Das ist vermutlich die ehrlichste Kennzahl für das ganze Projekt: Das Korrektursystem ist der eigentliche Knackpunkt.
Fazit: Warum das Produktionssystem aus der Praxis entstand
41 Tage, 217 Commits – und wenig davon sieht im Rückblick nach einem geradlinigen Plan aus. Ein Checkpoint-Mechanismus, der nach einem Tag verworfen wurde. Eine Korrektur-Hierarchie, die in mehreren Etappen entstand. Eine Codebasis, die erst bei fast 2.500 Zeilen unhandlich genug wurde, um an einem einzigen Tag neu strukturiert zu werden.
Die Scripte und die finale GUI, die das Projekt heute steuern, sind fast alle direkte Antworten auf konkrete, teilweise teure Fehler.
Vermutlich hätte man mit einer präzisen Spezifikation viele dieser Fehler vermeiden können. Nur fehlte mir die Erfahrung, um diese Spec auch gut zu schreiben - und der Zauber eines neuen Projekts liegt für mich oft darin, einfach loszulegen.
Wenn du Lust hast, einmal reinzuhören: Das Hörbuch ist auf YouTube kostenlos verfügbar.
Häufige Fragen zur KI-Hörbuchproduktion
Worauf sollte man unbedingt achten?
- Im technischen Prozess so lange wie möglich mit einem verlustlosen Audio-Format wie flac arbeiten. Alle Verarbeitungsschritte auf Basis von MP3 kosten Audioqualität.
- ElevenLabs bietet ein pronunciation dict. Bei sehr spezifischen Begriffen unbedingt nutzen!
Wie kann man starten?
Klein starten ist immer eine gute Idee: Ein erstes Python-Script, welches die ElevenLabs-API anspricht und ein Audio von einer Minute Länge erzeugt, umfasst nur wenige Zeilen.
Nach der ersten Euphorie macht es aus meiner Sicht dann aber Sinn, sich Gedanken für den Workflow zu machen - insbesondere über Korrekturen, die nicht zu teuer in der Generierung sind. Bei mir ist am Ende eine GUI entstanden, die die vielen Python-Scripte koordiniert hat.
Was kostet die Generierung eines Audio-Books?
Über den Daumen gepeilt habe ich Credits im Wert von ungefähr 60 € investiert. Rechnerisch hat jede Minute Hörbuch damit ca. 1,4 Cent gekostet.
Wie oft mussten Audio-Batches korrigiert werden?
Aus 291 eindeutigen Batches wurden insgesamt 489 Batch-Versionen – fast jeder zweite Batch brauchte also mindestens eine Korrekturrunde.