Workflow Schritt-für-Schritt Erklärung
1. Node: When clicking ‘Test workflow’
- Typ: Manual Trigger
- Funktion: Dieser Node startet den Workflow manuell, wenn der Benutzer auf ‚Test workflow‘ klickt.
2. Node: Get urls from own data source
- Typ: No Operation (noOp)
- Funktion: Holt URLs aus der definierten Datenquelle für die Verarbeitung.
3. Node: Example fields from data source
- Typ: Set
- Funktion: Definiert die zu bearbeitenden URLs in einem Array.
- Einstellungen:
- Feld: Page als Array mit Werten wie
["https://www.automake.io/", "https://www.n8n.io/"].
- Feld: Page als Array mit Werten wie
4. Node: Split out page URLs
- Typ: Split Out
- Funktion: Teilt die URLs auf, sodass jede URL einzeln verarbeitet werden kann.
- Einstellungen: Das Feld, das aufgeteilt werden soll, ist „Page“.
5. Node: 40 items at a time
- Typ: Limit
- Funktion: Setzt eine Obergrenze von 40 Elementen, die gleichzeitig verarbeitet werden.
- Einstellungen:
maxItems: 40.
6. Node: 10 at a time
- Typ: Split in Batches
- Funktion: Teilt die Verarbeitung in Chargen von 10 auf.
- Einstellungen:
batchSize: 10.
7. Node: Wait
- Typ: Wait
- Funktion: Wartezeit von 45 Sekunden zwischen den Anfragen, um API-Grenzen einzuhalten.
- Einstellungen:
amount: 45.
8. Node: Retrieve Page Markdown and Links
- Typ: HTTP Request
- Funktion: Sendet eine POST-Anfrage an die Firecrawl API, um Markdown und Links von der URL zu holen.
- Einstellungen:
- URL:
https://api.firecrawl.dev/v1/scrape - Methode: POST
- Body: JSON mit der URL, die verarbeitet werden soll.
- Header: Content-Type ist
application/json.
- URL:
9. Node: Markdown data and Links
- Typ: Set
- Funktion: Definiert die exportierten Datenfelder: Title, Description, Content und Links.
- Einstellungen: Bestimmt die Werte anhand der API-Antwort.
10. Node: Connect to your own data source
- Typ: No Operation (noOp)
- Funktion: Stellt die Verbindung zu Ihrer eigenen Datenquelle her, um die verarbeiteten Daten zu speichern.
Ergebnis
Dieser Workflow automatisiert die Verarbeitung von Webseiten, indem er sie in ein geeignetes Markdown-Format umwandelt und gleichzeitig die Links extrahiert. Durch die Implementierung von API-Grenzen und die Verarbeitung in Chargen wird eine effektive Ressourcennutzung gewährleistet. Benutzer sollten jedoch sicherstellen, dass die richtigen Authentifizierungsparameter und Datenformatierungen angegeben sind, um die gewünschten Ergebnisse zu erzielen.