Workflow zur Verarbeitung von Webseiteninhalten in Markdown und Linkextraktion

Dieser Workflow nutzt die Firecrawl.dev API, um Webseiten in ein AI-freundliches Markdown-Format zu konvertieren und Links von den jeweiligen Webseiten zu extrahieren.

Workflow zur Verarbeitung von Webseiteninhalten in Markdown und Linkextraktion

Die Website nutzt die Wordpress-Infrastruktur.

Server: Unser Server befindet sich in einem Unternehmen mit Sitz in Deutschland. Er hat eine hohe und schnelle Internetverbindung. Es gibt eine Generatorunterstützung für ununterbrochenen Strom.

Workflow Schritt-für-Schritt Erklärung

1. Node: When clicking ‘Test workflow’

  • Typ: Manual Trigger
  • Funktion: Dieser Node startet den Workflow manuell, wenn der Benutzer auf ‚Test workflow‘ klickt.

2. Node: Get urls from own data source

  • Typ: No Operation (noOp)
  • Funktion: Holt URLs aus der definierten Datenquelle für die Verarbeitung.

3. Node: Example fields from data source

  • Typ: Set
  • Funktion: Definiert die zu bearbeitenden URLs in einem Array.
  • Einstellungen:
    • Feld: Page als Array mit Werten wie ["https://www.automake.io/", "https://www.n8n.io/"].

4. Node: Split out page URLs

  • Typ: Split Out
  • Funktion: Teilt die URLs auf, sodass jede URL einzeln verarbeitet werden kann.
  • Einstellungen: Das Feld, das aufgeteilt werden soll, ist „Page“.

5. Node: 40 items at a time

  • Typ: Limit
  • Funktion: Setzt eine Obergrenze von 40 Elementen, die gleichzeitig verarbeitet werden.
  • Einstellungen: maxItems: 40.

6. Node: 10 at a time

  • Typ: Split in Batches
  • Funktion: Teilt die Verarbeitung in Chargen von 10 auf.
  • Einstellungen: batchSize: 10.

7. Node: Wait

  • Typ: Wait
  • Funktion: Wartezeit von 45 Sekunden zwischen den Anfragen, um API-Grenzen einzuhalten.
  • Einstellungen: amount: 45.

8. Node: Retrieve Page Markdown and Links

  • Typ: HTTP Request
  • Funktion: Sendet eine POST-Anfrage an die Firecrawl API, um Markdown und Links von der URL zu holen.
  • Einstellungen:
    • URL: https://api.firecrawl.dev/v1/scrape
    • Methode: POST
    • Body: JSON mit der URL, die verarbeitet werden soll.
    • Header: Content-Type ist application/json.

9. Node: Markdown data and Links

  • Typ: Set
  • Funktion: Definiert die exportierten Datenfelder: Title, Description, Content und Links.
  • Einstellungen: Bestimmt die Werte anhand der API-Antwort.

10. Node: Connect to your own data source

  • Typ: No Operation (noOp)
  • Funktion: Stellt die Verbindung zu Ihrer eigenen Datenquelle her, um die verarbeiteten Daten zu speichern.

Ergebnis

Dieser Workflow automatisiert die Verarbeitung von Webseiten, indem er sie in ein geeignetes Markdown-Format umwandelt und gleichzeitig die Links extrahiert. Durch die Implementierung von API-Grenzen und die Verarbeitung in Chargen wird eine effektive Ressourcennutzung gewährleistet. Benutzer sollten jedoch sicherstellen, dass die richtigen Authentifizierungsparameter und Datenformatierungen angegeben sind, um die gewünschten Ergebnisse zu erzielen.

Facebook
Twitter
LinkedIn

Andere Projekte