Workflow zur KI-Sprachschnittstelle mit Webhook, Speicherverwaltung, OpenAI, Google Gemini & ElevenLabs

Dieser Workflow ermöglicht es, Sprachbefehle in Text umzuwandeln und dann entsprechend auf diese Texte zu reagieren, indem er KI-Modelle verwendet und die Konversation speichert.

Workflow zur KI-Sprachschnittstelle mit Webhook, Speicherverwaltung, OpenAI, Google Gemini & ElevenLabs

Die Website nutzt die Wordpress-Infrastruktur.

Server: Unser Server befindet sich in einem Unternehmen mit Sitz in Deutschland. Er hat eine hohe und schnelle Internetverbindung. Es gibt eine Generatorunterstützung für ununterbrochenen Strom.

Workflow-Übersicht

Dieser Workflow kombiniert mehrere n8n-Knoten, um eine automatisierte Sprachschnittstelle zu schaffen. Der Benutzer spricht einen Befehl, dieser wird in Text umgewandelt, und die Antwort wird mit einer KI-gestützten Text-zu-Sprache-Funktion ausgegeben.

Node-Details

1. Webhook

Typ: n8n-nodes-base.webhook
Was es macht: Es wartet auf HTTP-Anfragen von externen Anwendungen.

Einstellungen:

  • Path: voice_message – der Endpunkt, der die Sprachnachricht empfängt.
  • HTTP-Methode: POST – um Daten an den Server zu senden.

2. OpenAI – Speech to Text

Typ: @n8n/n8n-nodes-langchain.openAi
Was es macht: Wandelt Sprachdaten in Text um.

Einstellungen:

  • Resource: audio – gibt an, dass Audio verarbeitet wird.
  • Operation: transcribe – um die Sprache zu transkribieren.
  • Binary Property Name: voice_message – die eingehende Audiodatei wird hier gespeichert.

3. Get Chat

Typ: @n8n/n8n-nodes-langchain.memoryManager
Was es macht: Holt den bisherigen Kontext der Konversation.

Einstellungen:

  • Options: leer gelassen, um Standardoptionen zu verwenden.

4. Aggregate

Typ: n8n-nodes-base.aggregate
Was es macht: Aggregiert die Daten der vorherigen Nachrichten, um den Kontext zu erstellen.

Einstellungen:

  • Aggregate: aggregateAllItemData – alle Elemente zusammenfassen.
  • Destination Field Name: context – wo die aggregierten Daten gespeichert werden.

5. Basic LLM Chain

Typ: @n8n/n8n-nodes-langchain.chainLlm
Was es macht: Nutzt ein Sprachmodell, um auf die Benutzerfrage zu reagieren.

Einstellungen:

  • Text: verwendet den transkribierten Text aus dem vorherigen Schritt.
  • Messages: setzt eine vordefinierte Nachricht, um den vorherigen Kontext zu berücksichtigen.

6. Insert Chat

Typ: @n8n/n8n-nodes-langchain.memoryManager
Was es macht: Fügt die Benutzer- und AI-Nachrichten zum Speicher hinzu.

Einstellungen:

  • Mode: insert – um neue Daten in den Speicher einzufügen.
  • Messages: hier wird der Benutzertext und die AI-Antwort festgelegt.

7. Window Buffer Memory

Typ: @n8n/n8n-nodes-langchain.memoryBufferWindow
Was es macht: Verwaltet den Zustand des Gesprächs über verschiedene Anforderungen hinweg.

Einstellungen:

  • Session Key: test-0dacb3b5-4bcd-47dd-8456-dcfd8c258204 – eindeutiger Schlüssel für die Sitzung.
  • Session Id Type: customKey – definiert den Typ des Sitzungsschlüssels.

8. Google Gemini Chat Model

Typ: @n8n/n8n-nodes-langchain.lmChatGoogleGemini
Was es macht: Verwendet das Google Gemini-Modell, um die Antwort auf die Benutzeranfrage zu generieren.

Einstellungen:

  • Model Name: models/gemini-1.5-flash – der spezifische Modellname.

9. ElevenLabs – Generate Audio

Typ: n8n-nodes-base.httpRequest
Was es macht: Konvertiert generierten Text in Sprache mittels ElevenLabs API.

Einstellungen:

  • URL: wird dynamisch basierend auf der Voice-ID aufgebaut.
  • Method: POST – um Daten an die ElevenLabs-API zu senden.
  • Body Parameters: enthält den generierten Text, der in Audio umgewandelt werden soll.
  • Authentication: benutzt HTTP-Authentifizierung, um sich bei der API anzumelden.

10. Limit

Typ: n8n-nodes-base.limit
Was es macht: Beschränkt die Anzahl der zurückgegebenen Ergebnisse.

Einstellungen:

  • Keine besonderen Konfigurationen erforderlich.

11. Respond to Webhook

Typ: n8n-nodes-base.respondToWebhook
Was es macht: Sendet die generierte Audiodatei als Antwort auf die ursprüngliche Anfrage.

Einstellungen:

  • Respond With: binary – die Ausgabe gibt die Audiodaten zurück.

Ergebnis

Mit diesem Workflow können Benutzer mit einem KI-gestützten Sprachassistenten interagieren, der Sprachbefehle in Text umwandelt, die Konversation speichert und dann die Antworten in Sprache umwandelt. Dies eröffnet viele Möglichkeiten in der Sprachsteuerung und automatisierten Interaktion.

Facebook
Twitter
LinkedIn

Andere Projekte