1. Wenn auf „Workflow ausführen“ geklickt wird
Dies ist der Startpunkt des Workflows. Er löst den gesamten Ablauf aus, sobald der Button „Workflow ausführen“ gedrückt wird.
2. Datei-URL in Google Drive festlegen
Hier wird die URL einer Datei von Google Drive festgelegt, die später heruntergeladen und verarbeitet werden soll. Die URL lautet:
https://drive.google.com/file/d/11Koq9q53nkk0F5Y8eZgaWJUVR03I4-MM/view
3. Datei herunterladen
Dieser Knoten verwendet die Google Drive API, um die zuvor festgelegte Datei herunterzuladen. Die Parameter umfassen die Datei-ID, die aus der festgelegten URL extrahiert wird.
4. Metadaten hinzufügen
In diesem Knoten wird das heruntergeladene Dateidokument bearbeitet, um zusätzliche Metadaten wie Dateiname und Dateityp hinzuzufügen. Dies geschieht über einen Code, der ein neues JSON-Feld erstellt.
5. Zur Vektorspeicherung zu Pinecone hinzufügen
Hier wird das bearbeitete Dokument in den Pinecone-Vektorspeicher eingefügt, um es später für Abfragen zu verwenden. Der Knoten verwendet den Typ "insert".
6. Standarddatenloader
Dieser Knoten lädt die Daten, die dann in den Vektorspeicher geladen werden. Es handelt sich um ein binäres Datenformat.
7. Chunk-Generator (Textsplitter)
Eine wichtige Funktion im Workflow, die die heruntergeladene Datei in kleinere Abschnitte (Chunks) aufteilt, um effiziente Abfragen zu ermöglichen. Die Chunk-Größe und -Überlappung werden hier angegeben.
8. OpenAI-Embedding erstellen
Die Abschnitte der Datei werden dann an OpenAI gesendet, um Embeddings (Vektordarstellungen) zu erstellen, die für die Verarbeitung verwendet werden.
9. Chat auslösen
Dieser Knoten ist auf eine Webhook-Integration vorbereitet und wird aktiviert, wenn der Benutzer eine Anfrage stellt, die verarbeitet werden soll.
10. Top-Chunks basierend auf der Abfrage abrufen
In diesem Knoten werden die relevantesten Textabschnitte (Chunks) basierend auf der Benutzereingabe abgerufen. Hierbei wird das zuvor festgelegte Chunk-Limit berücksichtigt.
11. Antworten auf die Abfrage vorbereiten
Die gesammelten Chunks werden hier verarbeitet, um eine Antwort zu generieren, die die Frage des Benutzers berücksichtigt.
12. Antworten generieren
Zusammensetzung der Antwort: Dieser Knoten formatiert die generierte Antwort zusammen mit den jeweiligen Zitationen aus den Textabschnitten.
13. Zitationen kompilieren
Hier wird eine Übersicht der Zitationen erstellt, um dem Benutzer zu zeigen, aus welchen Abschnitten die Informationen stammen.
14. Ergebnis
Die finale Antwort wird zusammengestellt und bereitgestellt, die aus der OpenAI-Antwort und den Zitationen besteht, die während des Prozesses generiert wurden.
Ergebnis
Durch diesen Workflow gelingt es, große Datenmengen in gewerblichem und akademischem Umfeld zu verarbeiten, indem Dokumente heruntergeladen, bearbeitet und nützliche Einsichten durch KI abgerufen werden. Insbesondere wird hier mit dem Bitcoin Whitepaper gearbeitet, sofern der Benutzer die Datei nicht ändert.
Download Link: Workflow herunterladen