📌 Wie können Sie mit einem einzigen Crawler strukturierte Inhalte von mehreren öffentlichen Websites extrahieren?
Diese Vorlage sammelt strukturierte Seiteninhalte und Seitenmetadaten von vom Benutzer bereitgestellten öffentlichen Websites, vorbehaltlich der konfigurierten Crawling-Tiefe, des Seitenlimits und der Ausschlussregeln. Sie ist nützlich für Content-Rechercheure, Wissensdatenbank-Teams und Datenbetriebsteams.
Die Daten werden von vom Benutzer bereitgestellten öffentlichen Websites gesammelt. Diese Vorlage ist nicht an eine einzige Quell-Website gebunden. Sie beginnt mit den vom Benutzer angegebenen URLs öffentlicher Websites und extrahiert Seiteninhalte innerhalb des konfigurierten Crawling-Bereichs.
💰 Preise
Diese Vorlage ist derzeit kostenlos und hat keine Nutzungsgebühr pro Zeile. Tarif- oder Ressourcenlimits von Octoparse können weiterhin gelten.
📦 Ausgabe
Die aktuell veröffentlichte Implementierung kann die folgenden Felder zurückgeben:
msg_typecontenturltitleauthorpublished_atformaterror_message
{
"msg_type": null,
"content": "{\"text\": \"Eighty feet below the streets of Manhattan...\"}",
"url": "https://www.bloomberg.com/opinion/articles/...",
"title": "Why Is Germany Sitting on $599 Billion of Gold?",
"author": "Chris Bryant",
"published_at": "2026-01-29",
"format": "json",
"error_message": null
}
🎯 Anwendungsfälle
- Erstellen Sie Inhaltsarchive unter Verwendung von Seiten-URL, Titel, Autor und Veröffentlichungszeit.
- Bereiten Sie Website-Inhalte für die nachgelagerte Analyse im ausgewählten Format vor.
- Crawlen Sie begrenzte Website-Abschnitte mithilfe von Tiefen-, Seitenlimit- und Ausschlusssteuerungen.
- Überprüfen Sie nicht zugängliche Seiten anhand der Felder für URL und Fehlermeldung.
🐙 Warum Octoparse
- Einsatzbereiter Workflow: Die Extraktionsschritte für vom Benutzer bereitgestellte öffentliche Websites sind bereits konfiguriert, sodass Sie den Scraper nicht von Grund auf neu erstellen müssen.
- Flexible Ausführung: Führen Sie die vorgefertigte Aufgabe in der Cloud aus, ohne einen lokalen Computer für die Sammlung online halten zu müssen.
- Strukturierte, wiederholbare Ausgabe: Die Ergebnisse werden in konsistenten Zeilen zurückgegeben, die im Vergleich zu manuell kopierten Seiten einfacher zu vergleichen, zu filtern, zu deduplizieren und zu verarbeiten sind.
- Verifizierte Eingabe-Leitplanken: Das Formular zeigt die aktuellen Eingaben, auswählbaren Werte und sinnvollen Limits an, die für diese Vorlage konfiguriert sind.
- Praktische Datenübergabe: Überprüfen Sie die Ergebnisse in Octoparse und exportieren oder verarbeiten Sie sie mit den von Ihrer Octoparse-Umgebung unterstützten Optionen.
📝 Eingabe
Füllen Sie die folgenden Felder aus:
- Website-URL (Erforderlich) — Geben Sie die URL oder URLs der öffentlichen Website ein, bei der das Crawling beginnen soll. Bis zu 10.000 Einträge pro Durchlauf.
- Maximale Crawling-Tiefe (Optional) — Legen Sie fest, wie vielen Link-Ebenen der Crawler von jeder Start-URL aus folgen darf. Lassen Sie das Feld leer, um eine Crawling-Tiefe von 0 zu verwenden. Akzeptierter Bereich: 0 bis 5.
- Maximale Seiten pro URL (Optional) — Legen Sie die maximale Anzahl von Seiten fest, die für jede Start-URL gesammelt werden sollen. Lassen Sie das Feld leer, um 10 Seiten zu verwenden. Akzeptierter Bereich: 1 bis 1000.
- Format (Optional)
- Exclude_Glob (Optional) — Geben Sie ein Glob-Muster für URLs oder Pfade ein, die vom Crawl ausgeschlossen werden sollen.
- Output_Field_Name (Optional)
🚀 Wie man es benutzt
- Öffnen Sie die Vorlage und wählen Sie Ausprobieren oder Starten.
- Füllen Sie die oben aufgeführten Eingabefelder aus.
- Starten Sie die Aufgabe im unterstützten Cloud-Ausführungsmodus.
- Überprüfen Sie die Ausgabezeilen und exportieren oder verarbeiten Sie die strukturierten Daten.
⚠️ Einschränkungen
Die Ergebnisse hängen davon ab, was die Quell-Website zur Laufzeit bereitstellt. Ein aufgeführtes Ausgabefeld kann leer sein, wenn die Quellseite diesen Wert nicht liefert. Die oben gezeigten Eingabelimits werden von der Vorlage erzwungen.
💡 Tipps
Verwenden Sie spezifische, gültige Eingaben und überprüfen Sie ein repräsentatives Ergebnis, bevor Sie eine große Charge starten. Entfernen Sie doppelte Eingaben, wenn wiederholte Datensätze nicht benötigt werden.
❓ FAQ
Wie sammelt Octoparse Daten von vom Benutzer bereitgestellten öffentlichen Websites?
Die Python-Automatisierung startet von jeder übermittelten Website-URL, folgt geeigneten Links innerhalb der konfigurierten Tiefe und des Seitenlimits, schließt Links aus, die dem angegebenen Glob-Muster entsprechen, wandelt den Seiteninhalt in das ausgewählte Format um und lädt einen Datensatz pro verarbeiteter Seite hoch.
Welche Eingaben benötigt dieser Universal Content Scraper?
Verwenden Sie die im Abschnitt 'Eingabe' gezeigten Felder und akzeptierten Werte. Es werden nur für den Benutzer relevante Limits und auswählbare Optionen aufgeführt.
Welche Daten kann ich von vom Benutzer bereitgestellten öffentlichen Websites extrahieren?
Die aktuellen Ausgabefelder und eine repräsentative JSON-Datenvorschau sind im Abschnitt 'Ausgabe' aufgeführt. Die Verfügbarkeit der Felder kann variieren, wenn die Quellseite einen Wert nicht anzeigt.
Ist dieser Universal Content Scraper kostenlos?
Er ist derzeit kostenlos und hat keine Nutzungsgebühr pro Zeile. Tarif- oder Ressourcenlimits von Octoparse können weiterhin gelten.
Warum können einige Felder von vom Benutzer bereitgestellten öffentlichen Websites leer sein?
Quellseiten stellen nicht immer jeden Wert für jeden Datensatz bereit, und Layouts können je nach Artikel, Markt oder aktueller Website-Antwort variieren. Die Vorlage gibt ein Feld zurück, wenn die aktuelle Seite es bereitstellt.
Kann ich die gesammelten Daten von vom Benutzer bereitgestellten öffentlichen Websites exportieren?
Sie können die strukturierten Zeilen in Octoparse überprüfen und sie mit den von Ihrer Octoparse-Umgebung unterstützten Optionen exportieren oder verarbeiten.
🔗 Verwandte Vorlagen
- AI Crawl — Verwenden Sie KI-gesteuerten Umfang und Filter, wenn eine Website ein breiteres Crawling über mehrere Seiten erfordert.
- AI Scraper — Extrahieren Sie benutzerdefinierte Felder, wenn die genauen Zielseiten-URLs bereits bekannt sind.
- Google Search Scraper — Verwenden Sie die URLs von Google-Suchergebnissen, um öffentliche Websites oder Seiten für die Inhaltsextraktion zu identifizieren.