Workflow-Übersicht
Dieser Workflow kombiniert mehrere n8n-Knoten, um eine automatisierte Sprachschnittstelle zu schaffen. Der Benutzer spricht einen Befehl, dieser wird in Text umgewandelt, und die Antwort wird mit einer KI-gestützten Text-zu-Sprache-Funktion ausgegeben.
Node-Details
1. Webhook
Typ: n8n-nodes-base.webhook
Was es macht: Es wartet auf HTTP-Anfragen von externen Anwendungen.
Einstellungen:
- Path: voice_message – der Endpunkt, der die Sprachnachricht empfängt.
- HTTP-Methode: POST – um Daten an den Server zu senden.
2. OpenAI – Speech to Text
Typ: @n8n/n8n-nodes-langchain.openAi
Was es macht: Wandelt Sprachdaten in Text um.
Einstellungen:
- Resource: audio – gibt an, dass Audio verarbeitet wird.
- Operation: transcribe – um die Sprache zu transkribieren.
- Binary Property Name: voice_message – die eingehende Audiodatei wird hier gespeichert.
3. Get Chat
Typ: @n8n/n8n-nodes-langchain.memoryManager
Was es macht: Holt den bisherigen Kontext der Konversation.
Einstellungen:
- Options: leer gelassen, um Standardoptionen zu verwenden.
4. Aggregate
Typ: n8n-nodes-base.aggregate
Was es macht: Aggregiert die Daten der vorherigen Nachrichten, um den Kontext zu erstellen.
Einstellungen:
- Aggregate: aggregateAllItemData – alle Elemente zusammenfassen.
- Destination Field Name: context – wo die aggregierten Daten gespeichert werden.
5. Basic LLM Chain
Typ: @n8n/n8n-nodes-langchain.chainLlm
Was es macht: Nutzt ein Sprachmodell, um auf die Benutzerfrage zu reagieren.
Einstellungen:
- Text: verwendet den transkribierten Text aus dem vorherigen Schritt.
- Messages: setzt eine vordefinierte Nachricht, um den vorherigen Kontext zu berücksichtigen.
6. Insert Chat
Typ: @n8n/n8n-nodes-langchain.memoryManager
Was es macht: Fügt die Benutzer- und AI-Nachrichten zum Speicher hinzu.
Einstellungen:
- Mode: insert – um neue Daten in den Speicher einzufügen.
- Messages: hier wird der Benutzertext und die AI-Antwort festgelegt.
7. Window Buffer Memory
Typ: @n8n/n8n-nodes-langchain.memoryBufferWindow
Was es macht: Verwaltet den Zustand des Gesprächs über verschiedene Anforderungen hinweg.
Einstellungen:
- Session Key: test-0dacb3b5-4bcd-47dd-8456-dcfd8c258204 – eindeutiger Schlüssel für die Sitzung.
- Session Id Type: customKey – definiert den Typ des Sitzungsschlüssels.
8. Google Gemini Chat Model
Typ: @n8n/n8n-nodes-langchain.lmChatGoogleGemini
Was es macht: Verwendet das Google Gemini-Modell, um die Antwort auf die Benutzeranfrage zu generieren.
Einstellungen:
- Model Name: models/gemini-1.5-flash – der spezifische Modellname.
9. ElevenLabs – Generate Audio
Typ: n8n-nodes-base.httpRequest
Was es macht: Konvertiert generierten Text in Sprache mittels ElevenLabs API.
Einstellungen:
- URL: wird dynamisch basierend auf der Voice-ID aufgebaut.
- Method: POST – um Daten an die ElevenLabs-API zu senden.
- Body Parameters: enthält den generierten Text, der in Audio umgewandelt werden soll.
- Authentication: benutzt HTTP-Authentifizierung, um sich bei der API anzumelden.
10. Limit
Typ: n8n-nodes-base.limit
Was es macht: Beschränkt die Anzahl der zurückgegebenen Ergebnisse.
Einstellungen:
- Keine besonderen Konfigurationen erforderlich.
11. Respond to Webhook
Typ: n8n-nodes-base.respondToWebhook
Was es macht: Sendet die generierte Audiodatei als Antwort auf die ursprüngliche Anfrage.
Einstellungen:
- Respond With: binary – die Ausgabe gibt die Audiodaten zurück.
Ergebnis
Mit diesem Workflow können Benutzer mit einem KI-gestützten Sprachassistenten interagieren, der Sprachbefehle in Text umwandelt, die Konversation speichert und dann die Antworten in Sprache umwandelt. Dies eröffnet viele Möglichkeiten in der Sprachsteuerung und automatisierten Interaktion.