Hinweis: Diese Inhalte wurden mit Unterstützung von Künstlicher Intelligenz erstellt und redaktionell überprüft (Transparenzhinweis gemäß Art. 50 EU AI Act).
KI in der Film- und Videoproduktion
Hinweis zur Software-Auswahl:
Diese Dokumentation priorisiert Open-Source-Software, die unter Ubuntu läuft.
Bei kostenpflichtiger Software wird immer eine Open-Source-Alternative mit gleichem Funktionsumfang gegenübergestellt.
LLM-Modelle (ChatGPT, Claude, Gemini, Ollama u. a.) werden unabhängig vom Preis gelistet – sie sind Grundlage vieler KI-Workflows.
Legende
| Symbol | Bedeutung |
| 🟩 | Open Source – kostenlos, Ubuntu-kompatibel |
| 💰 | Kostenpflichtig |
| 🤖 | LLM-Modell – bleibt immer gelistet |
| 🐧 | Linux / Ubuntu nativ unterstützt |
| 🌐 | Nur Web-Browser (kein lokaler Install) |
Lernpfad-Übersicht
graph LR
A["🟢 Phase 1\nEinsteiger"] --> B["🟡 Phase 2\nFortgeschritten"]
B --> C["🔴 Phase 3\nExperte"]
A --> A1["Konzept verstehen\nErste Tools ausprobieren"]
B --> B1["Produktionskette\nverstehen & anwenden"]
C --> C1["Automatisieren\n& Skalieren"]
Inhaltsverzeichnis
🟢 Phase 1 – Einsteiger
Was lerne ich hier?
Grundlegende Konzepte verstehen: Wie denkt KI? Was kann sie – und was nicht?
Voraussetzungen: Keine. Nur Neugier und ein Browser.
1.1 Was ist KI-gestützte Videoproduktion?
Konzept: Drei Arten von KI in der Videoproduktion
| KI-Typ | Was sie tut | Beispiel |
| Generative KI | Erstellt etwas Neues aus einer Beschreibung (Prompt) | ComfyUI generiert ein Bild aus Text |
| Assistive KI | Verbessert oder analysiert bestehendes Material | DeepFilterNet rauscht Audio heraus |
| Automatisierungs-KI | Führt wiederkehrende Aufgaben selbstständig aus | n8n veröffentlicht Videos automatisch |
Konzept: Was ist ein Prompt?
❌ Schlechter Prompt: "Mach ein Video über Katzen"
✅ Guter Prompt: "Eine flauschige orange Katze schläft auf einem Fensterbrett,
weiches Morgenlicht, cineastisch, 4K, ruhige Bewegung"
Konzept: Was kann KI (noch) nicht?
- KI versteht keine Absichten – nur Beschreibungen
- KI macht kreative Fehler (z. B. falsche Finger, inkonsistente Gesichter)
- KI braucht immer noch einen Menschen als Regisseur
Einstiegs-Software (Open Source / LLM):
| Software | Typ | Was es kann | Ubuntu | Link |
| 🤖 ChatGPT | LLM | Ideen & Konzepte entwickeln | 🌐 Web | openai.com |
| 🤖 Claude | LLM | Strukturierte Texte & Analyse | 🌐 Web | claude.ai |
| 🤖 Gemini | LLM | Multimodales Brainstorming | 🌐 Web | gemini.google.com |
| 🤖 🟩 Ollama | LLM lokal | LLMs lokal auf Ubuntu ausführen | 🐧 Ja | ollama.com |
1.2 Konzept: Wie entsteht ein Video mit KI?
Der KI-Videoproduktions-Kreislauf
graph TD
A["💡 Idee\n(Was will ich zeigen?)"] --> B["📝 Skript\n(Was wird gesagt?)"]
B --> C["🖼️ Storyboard\n(Wie sieht es aus?)"]
C --> D["🎬 Produktion\n(Video generieren oder aufnehmen)"]
D --> E["✂️ Post-Produktion\n(Schnitt, Farbe, Audio)"]
E --> F["🚀 Veröffentlichung"]
| Produktionsphase | Open Source (Ubuntu) | Kostenpflichtige Alternative |
| Idee & Konzept | Ollama + lokale LLMs | ChatGPT, Claude |
| Skript | Ollama, LibreOffice Writer | Jasper AI, Sudowrite |
| Storyboard | ComfyUI, Stable Diffusion | Midjourney, DALL-E 3 |
| Videogenerierung | Wan2.1, CogVideoX | Runway ML, Kling AI |
| Schnitt | Kdenlive, DaVinci Resolve (Free) | Adobe Premiere Pro |
| Audio | Audacity, DeepFilterNet | iZotope RX 11 |
| Export / Untertitel | FFmpeg, Subtitle Edit | Sonix, Submagic |
1.3 Thema: Idee & Skript mit KI entwickeln
Konzept: Wie funktioniert ein Sprachmodell (LLM)?
Ein Large Language Model (LLM) hat aus Milliarden von Texten gelernt, wie Menschen schreiben. Es erzeugt wahrscheinliche Fortsetzungen deines Textes – kein Faktenwissen, sondern Sprachlogik.
- LLMs sind kreativ, aber nicht immer akkurat – Fakten prüfen!
- Lokale LLMs (Ollama) laufen ohne Internet und sind datenschutzkonform
Konzept: Prompt-Strategie für Skripte
Rolle: "Du bist ein erfahrener Dokumentarfilm-Autor."
Kontext: "Ich erstelle ein 3-minütiges YouTube-Video über..."
Aufgabe: "Schreibe ein Sprecherskript mit Einleitung, Hauptteil und Call-to-Action."
Format: "Max. 400 Wörter, gegliedert in Abschnitte."
Software – Open Source zuerst:
| Software | Typ | Funktion | Ubuntu | Link |
| 🟩 🤖 Ollama | LLM lokal | Lokale LLMs (Llama 3, Mistral, Phi-3) | 🐧 Ja | ollama.com |
| 🟩 🤖 LM Studio | LLM lokal | Grafische Oberfläche für lokale LLMs | 🐧 Ja | lmstudio.ai |
| 🟩 🤖 Jan.ai | LLM lokal | Open-Source ChatGPT-Alternative lokal | 🐧 Ja | jan.ai |
| 🤖 ChatGPT | LLM | Brainstorming, Skripte | 🌐 Web | openai.com |
| 🤖 Claude | LLM | Lange, strukturierte Texte | 🌐 Web | claude.ai |
| 🤖 Gemini | LLM | Multimodales Brainstorming | 🌐 Web | gemini.google.com |
Vergleich: Lokal vs. Cloud LLM
| Kriterium | Ollama / Jan.ai (lokal) 🟩 | ChatGPT / Claude 🤖 |
| Datenschutz | ✅ Vollständig lokal | ❌ Daten gehen in Cloud |
| Kosten | ✅ Kostenlos | 💰 Ab 20$/Monat (Pro) |
| Qualität | 🟡 Gut (Llama 3, Mistral) | ✅ Sehr gut |
| Internetverbindung | ✅ Nicht nötig | ❌ Erforderlich |
| Ubuntu-Support | 🐧 Nativ | 🌐 Nur Browser |
1.4 Thema: Bilder & Storyboards mit KI erstellen
Konzept: Was ist Text-to-Image?
Ein Diffusion-Modell beginnt mit zufälligem Bildrauschen und formt daraus schrittweise ein Bild, das zu deinem Prompt passt. Open-Source-Modelle laufen lokal auf deiner eigenen GPU.
Konzept: Stil-Konsistenz
- Seed fixieren – gleicher Zufallswert = ähnliches Bild
- Referenzbild mitgeben (Image-to-Image)
- LoRA-Modelle für konsistente Charaktere verwenden
Software – Open Source zuerst:
| Software | Typ | Funktion | Ubuntu | Link |
| 🟩 ComfyUI | Bild-KI | Leistungsstärkste lokale KI-Bildgenerierung | 🐧 Ja | github.com/comfyanonymous |
| 🟩 Stable Diffusion WebUI (AUTOMATIC1111) | Bild-KI | Benutzerfreundliche SD-Oberfläche | 🐧 Ja | github.com/AUTOMATIC1111 |
| 🟩 Flux (Black Forest Labs) | Bild-KI | Hochqualitative Open-Source-Modelle | 🐧 Ja | github.com/black-forest-labs |
| 🟩 Storyboarder | Storyboard | Dediziertes Storyboarding-Tool | 🐧 Ja | wonderunit.com |
| 🟩 Inkscape | Grafik | SVG-Vektorgrafik für Storyboards | 🐧 Ja | inkscape.org |
Vergleich: Open Source vs. Kommerziell
| Funktion | Open Source 🟩 (Ubuntu) | Kommerziell 💰 |
| Text-to-Image | ComfyUI + Flux / SDXL | Midjourney, DALL-E 3 |
| Bild-zu-Bild | ComfyUI (img2img) | Adobe Firefly |
| Stil-Konsistenz | ComfyUI + LoRA | Midjourney (--sref) |
| Storyboard-Tool | Storyboarder | Boords, FrameForge |
1.5 Thema: Erstes Video schneiden mit KI
Konzept: Was ist ein NLE?
Ein Non-Linear Editor (NLE) erlaubt das freie Anordnen von Videoclips auf einer Zeitleiste – im Gegensatz zu frühen linearen Schnittystemen.
Konzept: Text-basiertes Editing
Video aufnehmen → KI transkribiert → Du löschst Textzeilen → Video wird geschnitten
| Plattform | Format | KI-Tool |
| YouTube | 16:9 | Kdenlive / DaVinci Resolve |
| Instagram Reels / TikTok | 9:16 | Kdenlive Crop & Position |
| Instagram Feed | 1:1 | FFmpeg automatisch |
Software – Open Source zuerst:
| Software | Typ | Funktion | Ubuntu | Link |
| 🟩 Kdenlive | NLE | Vollwertiger Open-Source-Videoschnitt | 🐧 Ja | kdenlive.org |
| 🟩 OpenShot | NLE | Einfacher Einsteiger-Videoschnitt | 🐧 Ja | openshot.org |
| 🟩 Shotcut | NLE | Leichtgewichtiger NLE für Ubuntu | 🐧 Ja | shotcut.org |
| 🟩 FFmpeg | CLI | Automatisierter Schnitt per Skript | 🐧 Ja | ffmpeg.org |
| 🟩 Whisper.cpp | ASR | Lokale Transkription für text-basierten Schnitt | 🐧 Ja | github.com/ggerganov |
Vergleich: Open Source vs. Kommerziell
| Funktion | Open Source 🟩 (Ubuntu) | Kommerziell 💰 |
| Videoschnitt (NLE) | Kdenlive, Shotcut | Adobe Premiere Pro |
| Text-basiertes Editing | Kdenlive + Whisper.cpp | Descript |
| Automatische Clips | FFmpeg + Python-Skript | Opus Clip |
| Online-Tool | — | Clideo, Kapwing |
1.6 Thema: Audio automatisch verbessern
Konzept: Drei Audio-Ebenen
| Ebene | Inhalt | Open-Source-Tool |
| Dialog / Sprache | Gesprochene Worte, Interviews | DeepFilterNet, Audacity |
| Musik | Hintergrundmusik, Filmmusik | AudioCraft (Meta), MusicGen |
| Sounddesign | Atmosphäre, Effekte | Freesound + Audacity |
Konzept: Rauschunterdrückung durch KI
KI lernt, wie eine saubere Stimme klingt, und trennt sie vom Rauschen – algorithmisch, ähnlich dem Cocktail-Party-Effekt des Gehirns.
Konzept: Mastering
Automatisches Anpassen der Lautstärke, damit das Audio auf allen Geräten gleich klingt. Zielwert für YouTube: -14 LUFS.
Software – Open Source zuerst:
| Software | Typ | Funktion | Ubuntu | Link |
| 🟩 Audacity | Audio-Editor | Vollwertiger Open-Source-Audioeditor | 🐧 Ja | audacityteam.org |
| 🟩 DeepFilterNet | KI-Audio | KI-Rauschunterdrückung (lokal, GPU) | 🐧 Ja | github.com/Rikorose |
| 🟩 RNNoise | KI-Audio | Echtzeit-Rauschunterdrückung | 🐧 Ja | jmvalin.ca |
| 🟩 AudioCraft (Meta) | Musik-KI | Lokale KI-Musikgenerierung (MusicGen) | 🐧 Ja | github.com/facebookresearch |
| 🟩 Bark | TTS-KI | Open-Source Text-to-Speech & Musik | 🐧 Ja | github.com/suno-ai |
Vergleich: Open Source vs. Kommerziell
| Funktion | Open Source 🟩 (Ubuntu) | Kommerziell 💰 |
| Audio-Editor | Audacity | Adobe Audition |
| KI-Rauschunterdrückung | DeepFilterNet, RNNoise | iZotope RX 11, Krisp |
| 1-Klick Sprachverbesserung | DeepFilterNet CLI | Adobe Podcast Enhance |
| KI-Musikgenerierung | AudioCraft / MusicGen | Suno AI, Udio |
| TTS / Sprachsynthese | Bark, Coqui TTS | ElevenLabs |
| Audio-Mastering | Audacity + Normalisierung | Auphonic, LANDR |
🟡 Phase 2 – Fortgeschritten
Was lerne ich hier?
Den vollständigen Produktionsworkflow aufbauen und mit spezialisierten Open-Source-KI-Tools professionell umsetzen.
Voraussetzungen: Phase 1 abgeschlossen.
2.1 Konzept: Die drei Phasen einer Videoproduktion
graph LR
A["📋 Pre-Production\n(Vorproduktion)"] --> B["🎬 Production\n(Dreh / Generierung)"]
B --> C["🎞️ Post-Production\n(Nachbearbeitung)"]
A --> A1["Idee · Skript\nStoryboard · Planung"]
B --> B1["Kamera · KI-Video\nAudio aufnehmen"]
C --> C1["Schnitt · Farbe\nAudio · VFX · Export"]
2.2 Thema: Vorproduktion & Planung mit KI
Konzept: Was gehört zur Vorproduktion?
| Aufgabe | Open-Source-Tool | Kommerziell |
| Konzeptentwicklung | Ollama + Llama 3 | ChatGPT, Claude |
| Skript | LibreOffice Writer + Fountain | Final Draft, WriterDuet |
| Storyboard | Storyboarder + ComfyUI | Boords, FrameForge |
| Produktionsplan | Nextcloud + Deck / Trello OS | Airtable, StudioBinder |
| Projektmanagement | OpenProject, Planka | Notion AI |
Software – Open Source zuerst:
| Software | Typ | Funktion | Ubuntu | Link |
| 🟩 LibreOffice Writer | Text | Drehbuch & Dokumente schreiben | 🐧 Ja | libreoffice.org |
| 🟩 Fountain | Format | Drehbuch-Markup-Sprache (plain text) | 🐧 Ja | fountain.io |
| 🟩 Planka | Planung | Self-hosted Kanban-Board | 🐧 Ja | planka.app |
| 🟩 OpenProject | PM | Open-Source Projektmanagement | 🐧 Ja | openproject.org |
| 🟩 Nextcloud | Collaboration | Self-hosted Cloud & Teamarbeit | 🐧 Ja | nextcloud.com |
2.3 Thema: Professionelles Drehbuch mit KI-Assistenz
INT. KÜCHE - TAG
Maria (30, müde) gießt Kaffee ein.
MARIA
Heute wird alles anders.
Dieses Format ist im Fountain-Standard definiert – plain text, maschinenlesbar, versionierbar mit Git.
Konzept: KI als Co-Autor
KI liefert den ersten Entwurf, der Mensch verfeinert ihn. Lokale LLMs sind dabei datenschutzkonform.
Software – Open Source zuerst:
| Software | Typ | Funktion | Ubuntu | Link |
| 🟩 Fountain | Format | Drehbuch-Markup im Texteditor | 🐧 Ja | fountain.io |
| 🟩 Trelby | Drehbuch | Open-Source Drehbuch-Software | 🐧 Ja | trelby.org |
| 🟩 Ollama + Llama 3 | LLM lokal | Drehbuch-Entwurf lokal generieren | 🐧 Ja | ollama.com |
| 🟩 VSCodium + Fountain Plugin | Editor | Fountain-Drehbücher im Code-Editor | 🐧 Ja | vscodium.com |
Vergleich: Open Source vs. Kommerziell
| Funktion | Open Source 🟩 | Kommerziell 💰 |
| Drehbuch-Editor | Trelby, LibreOffice + Fountain | Final Draft, WriterDuet |
| KI-Unterstützung | Ollama + Llama 3 / Mistral | ChatGPT, Claude, Sudowrite |
| Kollaboratives Schreiben | Nextcloud + LibreOffice | WriterDuet, Google Docs |
2.4 Thema: KI beim Dreh & Kameraarbeit
Konzept: KI am Set – drei Einsatzgebiete
- Planung: Kamerabewegungen vorab in Blender simulieren
- Automatisierung: KI-Gimbal-Systeme tracken Motive automatisch
- Sicherung: Live-Histogramm und Fokus-Peaking in OBS / Darktable
Konzept: Was ist ein Gimbal?
Ein Gimbal ist eine elektronische Kamerastabilisierung. KI-gestützte Gimbals folgen Gesichtern automatisch – ohne manuelle Steuerung.
Konzept: In-Camera VFX (ICVFX)
LED-Wand als Hintergrund – KI synchronisiert Kamerabewegung mit dem LED-Inhalt (aus „The Mandalorian" bekannt). Open-Source-Alternative: Blender EEVEE als Echtzeit-Renderer für virtuelle Sets.
Software – Open Source zuerst:
| Software | Typ | Funktion | Ubuntu | Link |
| 🟩 Blender | 3D / Vorvisualisierung | Kamerabewegungen simulieren, virtuelle Sets | 🐧 Ja | blender.org |
| 🟩 OBS Studio | Aufnahme | Studioaufnahmen, Webcam, Bildschirm | 🐧 Ja | obsproject.com |
| 🟩 Darktable | RAW | RAW-Kamerabilder entwickeln | 🐧 Ja | darktable.org |
| 🟩 digiCamControl | Kamera | Remote-Kamerasteuerung | — | digicamcontrol.com |
Vergleich: Open Source vs. Kommerziell
| Funktion | Open Source 🟩 | Kommerziell 💰 |
| Kamera-Simulation / Previs | Blender | FrameForge |
| Bildschirmaufnahme / Streaming | OBS Studio | Streamlabs (kostenpflichtig) |
| Motion Control Software | Blender Animation | Dragonframe |
| RAW-Entwicklung | Darktable, RawTherapee | Adobe Lightroom |
Konzept: Schnitt-Stufen
Rough Cut → Alle Szenen grob zusammenstellen
Fine Cut → Präzise Schnittpunkte, Rhythmus optimieren
Online Edit → Farbe, VFX, Ton, Export
Konzept: Wie KI den Schnitt verändert
| Traditionell | KI-unterstützt (Open Source) |
| Manuell alle Clips sichten | Whisper.cpp transkribiert automatisch |
| Schnittpunkte manuell setzen | Kdenlive + Python-Skript analysiert Szenen |
| Untertitel manuell tippen | Subtitle Edit + Whisper |
| Ein Format exportieren | FFmpeg exportiert alle Formate automatisch |
Software – Open Source zuerst:
| Software | Typ | Funktion | Ubuntu | Link |
| 🟩 Kdenlive | NLE | Vollwertiger KI-unterstützter Schnitt | 🐧 Ja | kdenlive.org |
| 🟩 Shotcut | NLE | Leichtgewichtig, stabil | 🐧 Ja | shotcut.org |
| 🟩 OpenShot | NLE | Python-API für automatisierten Schnitt | 🐧 Ja | openshot.org |
| 🟩 FFmpeg | CLI | Vollautomatischer Schnitt per Skript | 🐧 Ja | ffmpeg.org |
| 🟩 Subtitle Edit | Untertitel | Untertitel-Editor + Whisper-Integration | 🐧 Ja | nikse.dk |
| 🟩 DaVinci Resolve (Free) | NLE | Branchenstandard, kostenlose Version | 🐧 Ja | blackmagicdesign.com |
Vergleich: Open Source vs. Kommerziell
| Funktion | Open Source 🟩 (Ubuntu) | Kommerziell 💰 |
| Vollwertiger NLE | Kdenlive, DaVinci Resolve (Free) | Adobe Premiere Pro |
| Text-basiertes Editing | Subtitle Edit + Whisper.cpp | Descript |
| Auto-Clips für Social Media | FFmpeg + Python | Opus Clip, Munch |
| Untertitelung | Subtitle Edit, Aegisub | Submagic, Kapwing |
2.6 Thema: Color Grading & Bildoptimierung mit KI
Konzept: Color Correction vs. Color Grading
Color Correction = Fehler beheben (technisch) → Belichtung, Weißabgleich
Color Grading = Stimmung erzeugen (kreativ) → Filmischer Look, Atmosphäre
Konzept: Was ist ein LUT?
Ein LUT (Look-Up Table) bildet jede Farbe auf eine neue ab. Open-Source-LUTs sind als .cube-Dateien frei verfügbar und in Kdenlive, DaVinci und FFmpeg nutzbar.
Konzept: KI-Upscaling
KI ergänzt fehlende Pixel intelligent – nicht nur durch simples Strecken. Open-Source-Tool: Upscayl für lokales 4K-Upscaling.
Software – Open Source zuerst:
| Software | Typ | Funktion | Ubuntu | Link |
| 🟩 DaVinci Resolve (Free) | Color | Professionellstes Color-Grading | 🐧 Ja | blackmagicdesign.com |
| 🟩 Kdenlive | Color | Color-Effekte & LUT-Integration | 🐧 Ja | kdenlive.org |
| 🟩 Upscayl | KI-Upscaling | Lokales KI-Upscaling (Real-ESRGAN) | 🐧 Ja | github.com/upscayl |
| 🟩 Real-ESRGAN | KI-Upscaling | CLI-basiertes Upscaling für Videos | 🐧 Ja | github.com/xinntao |
| 🟩 G'MIC | Bildfilter | Umfangreiche KI-Bildfilter | 🐧 Ja | gmic.eu |
| 🟩 Natron | Compositing | Knotenbasiertes Compositing (After Effects OS) | 🐧 Ja | natron.fr |
Vergleich: Open Source vs. Kommerziell
| Funktion | Open Source 🟩 (Ubuntu) | Kommerziell 💰 |
| Color Grading | DaVinci Resolve (Free) | DaVinci Resolve Studio |
| KI-Upscaling | Upscayl, Real-ESRGAN | Topaz Video AI |
| Rauschreduzierung Video | Real-ESRGAN, DeepFilterNet | Neat Video, Topaz |
| Film-Look-Simulation | DaVinci Free LUTs | FilmConvert Nitrate |
| Compositing | Natron, Blender Compositor | Adobe After Effects, Nuke |
2.7 Thema: Sounddesign & Musik mit KI
Konzept: Die drei Audio-Ebenen
| Ebene | Inhalt | Open-Source-Tool |
| Dialog | Gesprochene Worte | DeepFilterNet, Audacity |
| Musik | Filmmusik, Hintergrund | AudioCraft, MusicGen |
| Sounddesign | Atmosphäre, Effekte | Freesound.org + Audacity |
Konzept: Was ist Audio-Mastering?
Ziel: –14 LUFS für YouTube, –16 LUFS für Podcasts. Audacity kann dies mit dem LUFS-Analysator automatisch messen und anpassen.
Konzept: Voice Cloning – was ist erlaubt?
- ✅ Eigene Stimme klonen für konsistente Narration
- ✅ Offizielle Open-Source-Modelle für kommerzielle Nutzung (Coqui XTTS-v2)
- ❌ Stimmen anderer Personen ohne ausdrückliche Erlaubnis
Software – Open Source zuerst:
| Software | Typ | Funktion | Ubuntu | Link |
| 🟩 Audacity | Audio-Editor | Vollwertiger Audioeditor | 🐧 Ja | audacityteam.org |
| 🟩 DeepFilterNet | KI-Audio | KI-Rauschunterdrückung lokal | 🐧 Ja | github.com/Rikorose |
| 🟩 AudioCraft / MusicGen | Musik-KI | Lokale KI-Musikgenerierung (Meta) | 🐧 Ja | github.com/facebookresearch |
| 🟩 Bark | TTS | Open-Source TTS & Musik | 🐧 Ja | github.com/suno-ai |
| 🟩 Coqui XTTS-v2 | TTS | Voice Cloning lokal | 🐧 Ja | github.com/coqui-ai |
| 🟩 VoiceFixer | KI-Audio | KI-Sprachverbesserung lokal | 🐧 Ja | github.com/haoheliu |
| 🟩 LMMS | DAW | Open-Source Digital Audio Workstation | 🐧 Ja | lmms.io |
| 🟩 Ardour | DAW | Professionelle Open-Source-DAW | 🐧 Ja | ardour.org |
Vergleich: Open Source vs. Kommerziell
| Funktion | Open Source 🟩 (Ubuntu) | Kommerziell 💰 |
| Audio-Editor | Audacity, Ardour | Adobe Audition |
| KI-Rauschunterdrückung | DeepFilterNet, RNNoise | iZotope RX 11, Krisp |
| 1-Klick Sprachverbesserung | VoiceFixer CLI | Adobe Podcast Enhance |
| KI-Musikgenerierung | AudioCraft / MusicGen | Suno AI, Udio |
| Voice Cloning (lokal) | Coqui XTTS-v2, Bark | ElevenLabs |
| DAW | Ardour, LMMS | Logic Pro, Ableton |
| Audio-Mastering | Audacity (LUFS-Messung) | Auphonic, LANDR |
2.8 Thema: KI-Avatare & synthetische Presenter
Konzept: Avatar-Typen
| Typ | Beschreibung | Open-Source-Ansatz |
| Foto-Avatar | Foto wird animiert & spricht | SadTalker, DiffTalk |
| Video-Avatar | Aus echtem Video geklonter Presenter | Wav2Lip |
| 3D-Avatar | Computergenerierter Charakter | Blender + Rigify |
Konzept: Wann sinnvoll?
- ✅ Schulungsvideos in mehreren Sprachen
- ✅ Regelmäßige Content-Produktion ohne Kameraauftritt
- ❌ Nicht geeignet für emotionale, authentische Persönlichkeitsinhalte
Software – Open Source zuerst:
| Software | Typ | Funktion | Ubuntu | Link |
| 🟩 SadTalker | Avatar | Foto-to-Video-Avatar (lokal) | 🐧 Ja | github.com/OpenTalker |
| 🟩 Wav2Lip | Lipsync | Lippensynchronisierung lokal | 🐧 Ja | github.com/Rudrabha |
| 🟩 Blender + Rigify | 3D-Avatar | 3D-Charakter-Rigging & Animation | 🐧 Ja | blender.org |
| 🟩 Coqui XTTS-v2 | TTS | Voice für Avatar lokal | 🐧 Ja | github.com/coqui-ai |
Vergleich: Open Source vs. Kommerziell
| Funktion | Open Source 🟩 (Ubuntu) | Kommerziell 💰 |
| Foto spricht / Foto-Avatar | SadTalker | D-ID |
| Video-Lipsync | Wav2Lip | HeyGen Dubbing |
| 3D-Avatar-Erstellung | Blender + Rigify | DeepBrain AI |
| Enterprise Avatar-Videos | — | Synthesia, Colossyan |
2.9 Thema: Dubbing, Stimme & Untertitelung mit KI
Konzept: Untertitelung vs. Dubbing
| Methode | Beschreibung | Open-Source-Tool |
| Untertitelung | Text eingeblendet, Originalton bleibt | Subtitle Edit + Whisper |
| Voice-Over | Neuer Sprecher, Originalton leiser | Coqui TTS + FFmpeg |
| Lipsync-Dubbing | Lippensynchron neue Sprache | Wav2Lip |
Konzept: ASR – Automatische Spracherkennung
Whisper (OpenAI, Open Source) ist das genaueste frei verfügbare ASR-Modell – läuft lokal auf Ubuntu ohne Cloud-Anbindung.
# Whisper.cpp lokal verwenden
./main -m models/ggml-base.bin -f audio.wav --output-srt
Konzept: KI-Lipsync
KI analysiert Phoneme der neuen Sprache und verformt Mundbewegungen im Video entsprechend. Open-Source: Wav2Lip auf Ubuntu mit eigener GPU.
Software – Open Source zuerst:
| Software | Typ | Funktion | Ubuntu | Link |
| 🟩 Whisper.cpp | ASR | Lokale Transkription & Untertitel | 🐧 Ja | github.com/ggerganov |
| 🟩 Subtitle Edit | Untertitel | Untertitel-Editor + Whisper | 🐧 Ja | nikse.dk |
| 🟩 Aegisub | Untertitel | Professioneller Untertitel-Editor | 🐧 Ja | aegisub.org |
| 🟩 Wav2Lip | Lipsync | KI-Lipsync-Dubbing lokal | 🐧 Ja | github.com/Rudrabha |
| 🟩 Coqui XTTS-v2 | TTS | Mehrsprachige Sprachsynthese lokal | 🐧 Ja | github.com/coqui-ai |
| 🟩 DeepL (Free) | Übersetzung | Beste KI-Übersetzung (Free-Tier) | 🌐 Web | deepl.com |
| 🟩 LibreTranslate | Übersetzung | Vollständig Open-Source & self-hosted | 🐧 Ja | libretranslate.com |
Vergleich: Open Source vs. Kommerziell
| Funktion | Open Source 🟩 (Ubuntu) | Kommerziell 💰 |
| Automatische Transkription | Whisper.cpp (lokal) | Sonix, Descript |
| Untertitel-Editor | Subtitle Edit, Aegisub | Submagic, Kapwing |
| KI-Übersetzung | LibreTranslate, DeepL Free | DeepL Pro |
| Voice Cloning / Dubbing | Coqui XTTS-v2, Wav2Lip | ElevenLabs, HeyGen |
🔴 Phase 3 – Experte
Was lerne ich hier?
Produktionsprozesse automatisieren, KI-Agenten einsetzen und eigene Pipelines auf Ubuntu bauen.
Voraussetzungen: Phase 1 & 2 abgeschlossen. Python-Grundkenntnisse hilfreich.
3.1 Konzept: Von der Produktion zur Automatisierung
Was ist eine KI-Pipeline?
graph LR
A[Thema eingeben] --> B[KI schreibt Skript]
B --> C[TTS generiert Stimme]
C --> D[KI generiert Bilder]
D --> E[FFmpeg schneidet Video]
E --> F["Video veröffentlicht"]
style A fill:#4caf50,color:#fff
style F fill:#f44336,color:#fff
Konzept: Was ist ein KI-Agent?
Ein KI-Agent bekommt ein Ziel, plant selbstständig die Schritte, ruft Tools auf und überprüft das Ergebnis.
Konzept: No-Code vs. Low-Code vs. Code
| Ansatz | Tool (Open Source) | Für wen |
| No-Code | n8n (Self-hosted) | Einsteiger in Automatisierung |
| Low-Code | n8n + Python-Nodes | Fortgeschrittene |
| Code | LangChain, CrewAI | Entwickler |
3.2 Thema: Visuelle Effekte (VFX) mit KI
Konzept: Was sind VFX?
Visual Effects sind alle Elemente, die im Nachhinein ins Video eingefügt werden – Hintergrundersatz, Objektentfernung, CGI-Charaktere.
Konzept: Rotoscoping & KI-Masking
Früher: Stunden manueller Arbeit pro Sekunde. Heute: DaVinci Resolve Magic Mask (kostenlose Version) oder rembg (Open Source) erledigen das automatisch.
Konzept: Inpainting
KI „malt" entfernte Objekte aus dem Hintergrund nach. Open-Source: Stable Diffusion Inpainting in ComfyUI.
Konzept: NeRF – 3D aus Videos rekonstruieren
Neural Radiance Fields rekonstruieren aus mehreren 2D-Videos eine vollständige 3D-Szene. Open-Source: Nerfstudio.
Software – Open Source zuerst:
| Software | Typ | Funktion | Ubuntu | Link |
| 🟩 Natron | Compositing | Knotenbasiertes VFX-Compositing | 🐧 Ja | natron.fr |
| 🟩 Blender Compositor | VFX | Vollständige VFX-Pipeline in Blender | 🐧 Ja | blender.org |
| 🟩 rembg | Masking | KI-Hintergrundentfernung (lokal) | 🐧 Ja | github.com/danielgatis |
| 🟩 ComfyUI Inpainting | Inpainting | Objekte aus Videos entfernen | 🐧 Ja | github.com/comfyanonymous |
| 🟩 Nerfstudio | NeRF | 3D-Szenenrekonstruktion aus Video | 🐧 Ja | docs.nerf.studio |
| 🟩 Cascadeur (Free) | Animation | KI-gestützte 3D-Charakteranimation | 🐧 Ja | cascadeur.com |
| 🟩 DaVinci Resolve (Free) | VFX | Magic Mask, Fusion Compositor | 🐧 Ja | blackmagicdesign.com |
Vergleich: Open Source vs. Kommerziell
| Funktion | Open Source 🟩 (Ubuntu) | Kommerziell 💰 |
| VFX Compositing | Natron, Blender Compositor | Adobe After Effects, Nuke |
| KI-Hintergrundentfernung | rembg, DaVinci Free Magic Mask | Runway ML |
| Objekte entfernen (Inpainting) | ComfyUI Inpainting | Runway ML Inpainting |
| 3D-Szenenrekonstruktion (NeRF) | Nerfstudio | Luma AI |
| 3D-Charakteranimation | Blender + Cascadeur Free | Wonder Studio |
3.3 Thema: KI-Agenten als autonome Videoproduzenten
Konzept: Der ReAct-Zyklus eines KI-Agenten
graph LR
A[Ziel erhalten] --> B[Situation analysieren]
B --> C[Schritt planen]
C --> D[Tool aufrufen]
D --> E["Ergebnis prüfen"]
E --> F{"Ziel erreicht?"}
F -->|Nein| B
F -->|Ja| G[Fertig]
Konzept: Multi-Agenten-System für Video
| Agent | Aufgabe | Open-Source-Tool |
| Skript-Agent | Drehbuch erstellen | Ollama + LangChain |
| Bild-Agent | Storyboard generieren | ComfyUI API |
| Audio-Agent | Narration & Musik | Coqui TTS + AudioCraft |
| Schnitt-Agent | Alles zusammenführen | FFmpeg + MoviePy |
| Publish-Agent | Automatisch veröffentlichen | n8n |
Software – Open Source zuerst:
| Software | Typ | Funktion | Ubuntu | Link |
| 🟩 LangChain | Framework | LLM-Agenten-Framework (Python) | 🐧 Ja | langchain.com |
| 🟩 AutoGen (Microsoft) | Framework | Multi-Agenten-Orchestrierung | 🐧 Ja | microsoft.github.io/autogen |
| 🟩 CrewAI | Framework | Rollenbasierte KI-Agenten-Teams | 🐧 Ja | crewai.com |
| 🟩 n8n | Automatisierung | Self-hosted Workflow-Builder | 🐧 Ja | n8n.io |
| 🟩 Ollama | LLM | Lokaler LLM-Server für Agenten | 🐧 Ja | ollama.com |
| 🤖 ChatGPT API | LLM-API | Cloud-LLM für Agenten | 🌐 API | platform.openai.com |
| 🤖 Claude API | LLM-API | Cloud-LLM für Agenten | 🌐 API | anthropic.com |
3.4 Thema: Programmatische Videogenerierung
Konzept: Code als Kamera
Statt einen Editor zu öffnen: Code beschreibt das Video und rendert es automatisch.
# MoviePy – Beispiel
from moviepy.editor import VideoFileClip, concatenate_videoclips
clip1 = VideoFileClip("szene1.mp4")
clip2 = VideoFileClip("szene2.mp4")
final = concatenate_videoclips([clip1, clip2])
final.write_videofile("output.mp4")
Konzept: Wann sinnvoll?
- ✅ Datenvisualisierungen & Erklär-Animationen
- ✅ Videos mit sich wiederholenden Strukturen
- ✅ Automatisierte Content-Produktion in großem Maßstab
Framework-Vergleich (alle Open Source)
| Framework | Sprache | Stärke | Ubuntu |
| MoviePy | Python | Einfachster Einstieg | 🐧 Ja |
| Manim | Python | Mathematische Animationen | 🐧 Ja |
| FFmpeg | CLI / Python | Basis aller Video-Pipelines | 🐧 Ja |
| Hyperframes | HTML/CSS/JS | Agent-First-Framework | 🐧 Ja |
| Remotion | TypeScript/React | React-basierte Videos | 🐧 Ja |
Software – alle Open Source:
| Software | Typ | Funktion | Ubuntu | Link |
| 🟩 MoviePy | Python-Lib | Video-Scripting, Zusammenfügen | 🐧 Ja | zulko.github.io/moviepy |
| 🟩 Manim | Python-Lib | Mathematische Erklär-Animationen | 🐧 Ja | manim.community |
| 🟩 FFmpeg | CLI | Medienverarbeitung, Encoding | 🐧 Ja | ffmpeg.org |
| 🟩 Hyperframes | HTML/JS | Agent-First Video-Framework | 🐧 Ja | github.com/HeyGen-Official |
| 🟩 Remotion | TypeScript | React-Videos | 🐧 Ja | remotion.dev |
| 🟩 OpenShot Python API | Python | Automatischer Schnitt per Code | 🐧 Ja | openshot.org |
3.5 Thema: Vollständige Produktions-Pipelines bauen
Konzept: End-to-End-Pipeline (vollständig Open Source)
graph TD
A["🎯 Thema eingeben"] --> B["🤖 Ollama / LangChain\nSkript schreiben"]
B --> C["🎙️ Coqui XTTS\nNarration erzeugen"]
B --> D["🖼️ ComfyUI\nBilder generieren"]
C --> E["🎬 FFmpeg + MoviePy\nVideo zusammenstellen"]
D --> E
E --> F["🔊 Audacity CLI\nAudio normalisieren"]
F --> G["🔄 n8n\nAutomatisch veröffentlichen"]
G --> H["✅ Video online"]
Software – Open Source zuerst:
| Software | Typ | Funktion | Ubuntu | Link |
| 🟩 n8n | Automatisierung | Self-hosted Workflow-Builder | 🐧 Ja | n8n.io |
| 🟩 FFmpeg | CLI | Kern-Medienverarbeitung | 🐧 Ja | ffmpeg.org |
| 🟩 Gitea | Versionierung | Self-hosted Git für Pipeline-Code | 🐧 Ja | gitea.io |
| 🟩 Nextcloud | Storage | Self-hosted Dateispeicher | 🐧 Ja | nextcloud.com |
| 🟩 Portainer | Container | Docker-Management für KI-Services | 🐧 Ja | portainer.io |
Vergleich: Open Source vs. Kommerziell
| Funktion | Open Source 🟩 (Ubuntu) | Kommerziell 💰 |
| Workflow-Automatisierung | n8n (self-hosted) | Zapier, Make |
| Video-Review & Feedback | Nextcloud + Deck | Frame.io |
| Cloud-Speicher | Nextcloud | Google Drive, Dropbox |
| Container-Management | Portainer + Docker | AWS, GCP |
3.6 Thema: Ethik, Urheberrecht & Recht
Konzept: Wem gehört ein KI-generiertes Video?
| Frage | Aktueller Stand (DE/EU 2025/2026) |
| Urheberrecht auf KI-Output | In DE: kein automatisches Urheberrecht für reine KI-Werke |
| Trainingsdaten-Urheberrecht | Ungeklärt, viele Klagen laufen (Getty Images vs. Stability AI) |
| Kennzeichnungspflicht | EU AI Act: Synthetische Medien müssen als KI gekennzeichnet werden |
| Deepfakes | Unerlaubte Deepfakes von Personen sind in vielen Ländern illegal |
Konzept: Warum Open-Source-Modelle rechtlich sicherer sein können
- Open-Source-Modelle mit freien Trainingslizenzen (z. B. Flux Pro Train) geben mehr Rechtssicherheit
- Selbst gehostete Modelle unterliegen nicht den AGB kommerzieller Plattformen
- Outputs aus lokalen Modellen bleiben vollständig auf eigenem Server
Konzept: Faire Nutzung
- ✅ Eigene Stimme lokal klonen (Coqui XTTS-v2)
- ✅ Open-Source-Modelle für kommerzielle Zwecke (je nach Lizenz prüfen)
- ❌ Stimmen / Gesichter anderer ohne Erlaubnis klonen
- ❌ KI-generierte Inhalte ohne Kennzeichnung als menschlich ausgeben
Ressourcen:
📋 Praxisprojekte
🟢 Einsteiger: Erklärvideo (vollständig lokal & Open Source)
graph LR
A["📝 Skript\nOllama + Llama 3"] --> B["🎙️ Stimme\nCoqui XTTS-v2"]
B --> C["🖼️ Bilder\nComfyUI + Flux"]
C --> D["✂️ Schnitt\nFFmpeg + Kdenlive"]
D --> E["💬 Untertitel\nWhisper.cpp + Subtitle Edit"]
E --> F["✅ Fertiges Video"]
Software (alle Open Source): Ollama · Coqui XTTS · ComfyUI · FFmpeg · Kdenlive · Whisper.cpp
graph LR
A["📹 Langes Video"] --> B["📄 Transkription\nWhisper.cpp"]
B --> C["✂️ Szenenanalyse\nPython + FFmpeg"]
C --> D["💬 Untertitel\nSubtitle Edit"]
D --> E["✅ Reels / Shorts"]
Software (alle Open Source): Whisper.cpp · Python · FFmpeg · Subtitle Edit
🟡 Fortgeschritten: Erklär-Animation mit Manim
graph LR
A["📐 Konzept"] --> B["🐍 Manim Code"]
B --> C["🎨 Animation rendern"]
C --> D["🎙️ Narration\nCoqui XTTS"]
D --> E["🔧 MoviePy + FFmpeg"]
E --> F["✅ Fertige Animation"]
Software (alle Open Source): Manim · Coqui XTTS · MoviePy · FFmpeg
🔴 Experte: Vollautomatische KI-Video-Pipeline (Open Source)
graph TD
A["🎯 Thema per n8n"] --> B["🤖 LangChain + Ollama\nSkript schreiben"]
B --> C["🎙️ Coqui XTTS\nNarration erzeugen"]
B --> D["🖼️ ComfyUI\nBilder generieren"]
C --> E["🎬 FFmpeg + MoviePy\nZusammenstellen"]
D --> E
E --> F["🔊 DeepFilterNet\nAudio optimieren"]
F --> G["🔄 n8n\nAutomatisch hochladen"]
G --> H["✅ Video online"]
Software (alle Open Source): n8n · LangChain · Ollama · Coqui XTTS · ComfyUI · FFmpeg · MoviePy · DeepFilterNet
📦 Vollständige Softwareübersicht & Vergleich
LLM-Modelle (bleiben unabhängig vom Preis)
| Software | Lokal / Cloud | Ubuntu | Preis | Link |
| 🟩 🤖 Ollama | Lokal | 🐧 Ja | Kostenlos | ollama.com |
| 🟩 🤖 LM Studio | Lokal | 🐧 Ja | Kostenlos | lmstudio.ai |
| 🟩 🤖 Jan.ai | Lokal | 🐧 Ja | Kostenlos | jan.ai |
| 🤖 ChatGPT | Cloud | 🌐 Web | Freemium | openai.com |
| 🤖 Claude | Cloud | 🌐 Web | Freemium | claude.ai |
| 🤖 Gemini | Cloud | 🌐 Web | Freemium | gemini.google.com |
Schnitt & Post-Produktion
| Funktion | Open Source 🟩 (Ubuntu) | Kommerziell 💰 |
| Vollwertiger NLE | Kdenlive 🐧, Shotcut 🐧, OpenShot 🐧 | Adobe Premiere Pro |
| Professioneller NLE | DaVinci Resolve Free 🐧 | DaVinci Resolve Studio |
| Text-basierter Schnitt | Kdenlive + Whisper.cpp | Descript |
| Auto-Clips Social Media | FFmpeg + Python 🐧 | Opus Clip, Munch |
| Untertitel-Editor | Subtitle Edit 🐧, Aegisub 🐧 | Submagic, Kapwing |
| VFX / Compositing | Natron 🐧, Blender Compositor 🐧 | After Effects, Nuke |
KI-Bildgenerierung
| Funktion | Open Source 🟩 (Ubuntu) | Kommerziell 💰 |
| Text-to-Image | ComfyUI + Flux 🐧, AUTOMATIC1111 🐧 | Midjourney, DALL-E 3 |
| Image-to-Image | ComfyUI (img2img) 🐧 | Adobe Firefly |
| Storyboard-Tool | Storyboarder 🐧 | Boords, FrameForge |
| KI-Upscaling | Upscayl 🐧, Real-ESRGAN 🐧 | Topaz Video AI |
KI-Audio & Musik
| Funktion | Open Source 🟩 (Ubuntu) | Kommerziell 💰 |
| Audio-Editor | Audacity 🐧, Ardour 🐧 | Adobe Audition |
| KI-Rauschunterdrückung | DeepFilterNet 🐧, RNNoise 🐧 | iZotope RX 11, Krisp |
| KI-Musikgenerierung | AudioCraft / MusicGen 🐧 | Suno AI, Udio |
| Voice Cloning / TTS | Coqui XTTS-v2 🐧, Bark 🐧 | ElevenLabs |
| Sprachverbesserung | VoiceFixer 🐧 | Adobe Podcast Enhance |
| Audio-Mastering | Audacity LUFS-Tool 🐧 | Auphonic, LANDR |
KI-Avatar & Dubbing
| Funktion | Open Source 🟩 (Ubuntu) | Kommerziell 💰 |
| Foto-Avatar | SadTalker 🐧 | D-ID |
| Lipsync-Dubbing | Wav2Lip 🐧 | HeyGen |
| 3D-Avatar | Blender + Rigify 🐧 | DeepBrain AI |
| Enterprise-Avatar | — | Synthesia, Colossyan |
Spracherkennung & Untertitelung
| Funktion | Open Source 🟩 (Ubuntu) | Kommerziell 💰 |
| Automatische Transkription | Whisper.cpp 🐧 (lokal) | Sonix, Descript |
| Untertitel-Editor | Subtitle Edit 🐧, Aegisub 🐧 | Submagic |
| KI-Übersetzung | LibreTranslate 🐧 (self-hosted) | DeepL Pro |
Automatisierung & Agenten
| Funktion | Open Source 🟩 (Ubuntu) | Kommerziell 💰 |
| Workflow-Automatisierung | n8n (self-hosted) 🐧 | Zapier, Make |
| LLM-Agenten-Framework | LangChain 🐧, CrewAI 🐧 | — |
| Multi-Agenten | AutoGen 🐧, CrewAI 🐧 | — |
| Programmatische Videos | MoviePy 🐧, Manim 🐧, FFmpeg 🐧 | — |
| Self-hosted Git | Gitea 🐧 | GitHub |
| Self-hosted Cloud | Nextcloud 🐧 | Google Drive |
VFX & 3D
| Funktion | Open Source 🟩 (Ubuntu) | Kommerziell 💰 |
| 3D-Suite | Blender 🐧 | Cinema 4D, Maya |
| VFX-Compositor | Natron 🐧, Blender Compositor 🐧 | Nuke, After Effects |
| Hintergrundentfernung | rembg 🐧 | Runway ML |
| 3D-Szenenrekonstruktion | Nerfstudio 🐧 | Luma AI |
| KI-Charakteranimation | Cascadeur Free 🐧 | Wonder Studio |
Weiterführende Ressourcen
Letzte Aktualisierung: Juli 2026
Hinweis: Diese Inhalte wurden mit Unterstützung von Künstlicher Intelligenz erstellt und redaktionell überprüft (Transparenzhinweis gemäß Art. 50 EU AI Act).