Workflow für die Dateiverarbeitung und Abfrage mit OpenAI

Dieser Workflow ermöglicht die Verarbeitung von Dateien, das Erstellen von Vektoren und die Interaktion mit einem OpenAI-Modell zur Beantwortung von Fragen basierend auf den Dateiinhalten.

Workflow für die Dateiverarbeitung und Abfrage mit OpenAI

Die Website nutzt die Wordpress-Infrastruktur.

Server: Unser Server befindet sich in einem Unternehmen mit Sitz in Deutschland. Er hat eine hohe und schnelle Internetverbindung. Es gibt eine Generatorunterstützung für ununterbrochenen Strom.

1. Wenn auf „Workflow ausführen“ geklickt wird

Dies ist der Startpunkt des Workflows. Er löst den gesamten Ablauf aus, sobald der Button „Workflow ausführen“ gedrückt wird.

2. Datei-URL in Google Drive festlegen

Hier wird die URL einer Datei von Google Drive festgelegt, die später heruntergeladen und verarbeitet werden soll. Die URL lautet:
https://drive.google.com/file/d/11Koq9q53nkk0F5Y8eZgaWJUVR03I4-MM/view

3. Datei herunterladen

Dieser Knoten verwendet die Google Drive API, um die zuvor festgelegte Datei herunterzuladen. Die Parameter umfassen die Datei-ID, die aus der festgelegten URL extrahiert wird.

4. Metadaten hinzufügen

In diesem Knoten wird das heruntergeladene Dateidokument bearbeitet, um zusätzliche Metadaten wie Dateiname und Dateityp hinzuzufügen. Dies geschieht über einen Code, der ein neues JSON-Feld erstellt.

5. Zur Vektorspeicherung zu Pinecone hinzufügen

Hier wird das bearbeitete Dokument in den Pinecone-Vektorspeicher eingefügt, um es später für Abfragen zu verwenden. Der Knoten verwendet den Typ "insert".

6. Standarddatenloader

Dieser Knoten lädt die Daten, die dann in den Vektorspeicher geladen werden. Es handelt sich um ein binäres Datenformat.

7. Chunk-Generator (Textsplitter)

Eine wichtige Funktion im Workflow, die die heruntergeladene Datei in kleinere Abschnitte (Chunks) aufteilt, um effiziente Abfragen zu ermöglichen. Die Chunk-Größe und -Überlappung werden hier angegeben.

8. OpenAI-Embedding erstellen

Die Abschnitte der Datei werden dann an OpenAI gesendet, um Embeddings (Vektordarstellungen) zu erstellen, die für die Verarbeitung verwendet werden.

9. Chat auslösen

Dieser Knoten ist auf eine Webhook-Integration vorbereitet und wird aktiviert, wenn der Benutzer eine Anfrage stellt, die verarbeitet werden soll.

10. Top-Chunks basierend auf der Abfrage abrufen

In diesem Knoten werden die relevantesten Textabschnitte (Chunks) basierend auf der Benutzereingabe abgerufen. Hierbei wird das zuvor festgelegte Chunk-Limit berücksichtigt.

11. Antworten auf die Abfrage vorbereiten

Die gesammelten Chunks werden hier verarbeitet, um eine Antwort zu generieren, die die Frage des Benutzers berücksichtigt.

12. Antworten generieren

Zusammensetzung der Antwort: Dieser Knoten formatiert die generierte Antwort zusammen mit den jeweiligen Zitationen aus den Textabschnitten.

13. Zitationen kompilieren

Hier wird eine Übersicht der Zitationen erstellt, um dem Benutzer zu zeigen, aus welchen Abschnitten die Informationen stammen.

14. Ergebnis

Die finale Antwort wird zusammengestellt und bereitgestellt, die aus der OpenAI-Antwort und den Zitationen besteht, die während des Prozesses generiert wurden.

Ergebnis

Durch diesen Workflow gelingt es, große Datenmengen in gewerblichem und akademischem Umfeld zu verarbeiten, indem Dokumente heruntergeladen, bearbeitet und nützliche Einsichten durch KI abgerufen werden. Insbesondere wird hier mit dem Bitcoin Whitepaper gearbeitet, sofern der Benutzer die Datei nicht ändert.

Download Link: Workflow herunterladen

Facebook
Twitter
LinkedIn

Andere Projekte