Workflow zur Video-Narration mit KI-unterstützter Texterstellung

Dieses n8n Workflow extrahiert Frames aus einem Video und generiert mithilfe einer KI ein Skript, das anschließend als Voiceover verwendet wird.

Workflow zur Video-Narration mit KI-unterstützter Texterstellung

Die Website nutzt die Wordpress-Infrastruktur.

Server: Unser Server befindet sich in einem Unternehmen mit Sitz in Deutschland. Er hat eine hohe und schnelle Internetverbindung. Es gibt eine Generatorunterstützung für ununterbrochenen Strom.

1. Herunterladen des Videos

Der erste Schritt im Workflow besteht darin, ein Video von einer URL herunterzuladen. Hier verwenden wir den HTTP Request Node, um einen Stockvideo-Clip von Pixabay herunterzuladen.

2. Video in Frames unterteilen

Der Code Node namens Capture Frames wird verwendet, um Frames aus dem heruntergeladenen Video mithilfe von Python und der OpenCV-Bibliothek zu extrahieren. Hier werden maximal 90 Frames erfasst, die gleichmäßig über das Video verteilt sind. Dies erfolgt durch Dekodierung des Base64-Codes des Videos und das Speichern in einer temporären Datei sowie die anschließende Verwendung von OpenCV für die Frame-Extraktion.

3. Frames aufteilen

Mit dem Node Split Out Frames teilen wir die Frames, die im vorherigen Schritt extrahiert wurden, in einzelne Teile auf, sodass sie für weitere Verarbeitungsschritte verwendet werden können.

4. Frames in Binärformat umwandeln

Hier kommt der Node Convert to Binary ins Spiel. Er wandelt die extrahierten Frames in ein Binärformat um, da dies für die Verarbeitung mit dem LLM (Language Model) erforderlich ist.

5. Resizing der Frames

Der Node Resize Frame wird verwendet, um die Größe der Frames auf 768×768 Pixel festzulegen, um sicherzustellen, dass sie den Anforderungen des LLM entsprechen.

6. Synchronisierung der Frames

Der Node For Every 15 Frames teilt die Frames in Batches von jeweils 15 auf. Dies hilft, die Verarbeitungszeit zu optimieren und die API-Ratenbegrenzungen einzuhalten.

7. Skripterstellung

Mit dem Node Generate Narration Script wird ein Skript auf der Grundlage der extrahierten Frames erstellt. Hier geben wir dem Modell Anweisungen, das Skript in einem bestimmten Stil (z.B. David Attenborough) zu erstellen.

8. Texterstellung und Sprachausgabe

Der Node Use Text-to-Speech verwendet die von OpenAI bereitgestellte Sprachausgabe, um eine Audioausgabe des Skripts zu erzeugen. Das Ergebnis wird als MP3-Datei zurückgegeben.

9. Hochladen zu Google Drive

Der letzte Schritt beinhaltet das Hochladen der generierten Audioausgabe zum Google Drive über den Node Upload to GDrive, damit die Datei leicht zugänglich ist.

Ergebnis

Das Endresultat dieses Workflows ist eine automatisierte Pipeline, die ein Video analysiert, relevante Frames extrahiert, ein Skript generiert und dieses dann in eine Sprachausgabe umwandelt, die bequem in Google Drive gespeichert wird.

Facebook
Twitter
LinkedIn

Andere Projekte