1. Herunterladen des Videos
Der erste Schritt im Workflow besteht darin, ein Video von einer URL herunterzuladen. Hier verwenden wir den HTTP Request Node, um einen Stockvideo-Clip von Pixabay herunterzuladen.
2. Video in Frames unterteilen
Der Code Node namens Capture Frames wird verwendet, um Frames aus dem heruntergeladenen Video mithilfe von Python und der OpenCV-Bibliothek zu extrahieren. Hier werden maximal 90 Frames erfasst, die gleichmäßig über das Video verteilt sind. Dies erfolgt durch Dekodierung des Base64-Codes des Videos und das Speichern in einer temporären Datei sowie die anschließende Verwendung von OpenCV für die Frame-Extraktion.
3. Frames aufteilen
Mit dem Node Split Out Frames teilen wir die Frames, die im vorherigen Schritt extrahiert wurden, in einzelne Teile auf, sodass sie für weitere Verarbeitungsschritte verwendet werden können.
4. Frames in Binärformat umwandeln
Hier kommt der Node Convert to Binary ins Spiel. Er wandelt die extrahierten Frames in ein Binärformat um, da dies für die Verarbeitung mit dem LLM (Language Model) erforderlich ist.
5. Resizing der Frames
Der Node Resize Frame wird verwendet, um die Größe der Frames auf 768×768 Pixel festzulegen, um sicherzustellen, dass sie den Anforderungen des LLM entsprechen.
6. Synchronisierung der Frames
Der Node For Every 15 Frames teilt die Frames in Batches von jeweils 15 auf. Dies hilft, die Verarbeitungszeit zu optimieren und die API-Ratenbegrenzungen einzuhalten.
7. Skripterstellung
Mit dem Node Generate Narration Script wird ein Skript auf der Grundlage der extrahierten Frames erstellt. Hier geben wir dem Modell Anweisungen, das Skript in einem bestimmten Stil (z.B. David Attenborough) zu erstellen.
8. Texterstellung und Sprachausgabe
Der Node Use Text-to-Speech verwendet die von OpenAI bereitgestellte Sprachausgabe, um eine Audioausgabe des Skripts zu erzeugen. Das Ergebnis wird als MP3-Datei zurückgegeben.
9. Hochladen zu Google Drive
Der letzte Schritt beinhaltet das Hochladen der generierten Audioausgabe zum Google Drive über den Node Upload to GDrive, damit die Datei leicht zugänglich ist.
Ergebnis
Das Endresultat dieses Workflows ist eine automatisierte Pipeline, die ein Video analysiert, relevante Frames extrahiert, ein Skript generiert und dieses dann in eine Sprachausgabe umwandelt, die bequem in Google Drive gespeichert wird.