📌 Wie kann KI benutzerdefinierte Felder aus einer Liste von Webseiten extrahieren?
Diese Vorlage sammelt strukturierte, vom Benutzer angeforderte Felder von jeder bereitgestellten öffentlichen Seiten-URL. Sie ist nützlich für No-Code-Datenanwender, Forschungsteams und Datenbetriebsteams.
Daten werden von vom Benutzer bereitgestellten öffentlichen Webseiten gesammelt. Diese Vorlage ist nicht an eine bestimmte Quell-Website gebunden. Sie extrahiert vom Benutzer angeforderte Felder aus den für die Aufgabe bereitgestellten öffentlichen Seiten-URLs.
💰 Preise
Für diese Vorlage fällt keine Nutzungsgebühr pro Zeile an. Der Basic Proxy ist kostenlos. Der Enhanced Proxy kostet zusätzlich 0,04 $ pro URL. Auto versucht zuerst den Basic Proxy und wechselt automatisch zum Enhanced Proxy, wenn Basic fehlschlägt; dieser Wechsel kann die Gebühr für den Enhanced Proxy hinzufügen.
📦 Ausgabe
Die Ausgabefelder werden durch die Extraktionsanweisungen des Benutzers definiert, daher hat diese Vorlage kein festes Ausgabefeld-Schema.
{}
🎯 Anwendungsfälle
- Extrahieren Sie Produktattribute wie Titel und Preise, wenn diese Felder explizit angefordert werden.
- Sammeln Sie Artikel- oder Angebotsattribute von heterogenen Seitenlayouts unter Verwendung einer gemeinsamen Feldspezifikation.
- Erstellen Sie einen Prototyp eines strukturierten Datensatzes, bevor Sie einen standortspezifischen Scraper erstellen.
- Verarbeiten Sie Seiten, die den ausgewählten Proxy oder die bereitgestellten Cookies erfordern, wenn diese Einstellungen angegeben werden.
🐙 Warum Octoparse
- Einsatzbereiter Workflow: Die Extraktionsschritte für vom Benutzer bereitgestellte öffentliche Webseiten sind bereits konfiguriert, sodass Sie den Scraper nicht von Grund auf neu erstellen müssen.
- Flexible Ausführung: Führen Sie die vorgefertigte Aufgabe in der Cloud aus, ohne einen lokalen Computer für die Sammlung online halten zu müssen.
- Strukturierte, wiederholbare Ausgabe: Die Ergebnisse werden als konsistente Zeilen zurückgegeben, die einfacher zu vergleichen, zu filtern, zu deduplizieren und zu verarbeiten sind als manuell kopierte Seiten.
- Verifizierte Eingabe-Leitplanken: Das Formular zeigt die aktuellen Eingaben, auswählbaren Werte und sinnvollen Grenzwerte an, die für diese Vorlage konfiguriert sind.
- Praktische Datenübergabe: Überprüfen Sie die Ergebnisse in Octoparse und exportieren oder verarbeiten Sie sie mit den von Ihrer Octoparse-Umgebung unterstützten Optionen.
📝 Eingabe
Füllen Sie die folgenden Felder aus:
- Ziel-URLs (Erforderlich) — Geben Sie die zu verarbeitenden öffentlichen Seiten-URLs ein. Es wird empfohlen, mit nicht mehr als 10 URLs zu beginnen, um eine übermäßige Nutzung von Credits zu vermeiden. Bis zu 10.000 Einträge pro Durchlauf.
- Zu extrahierende Felder (Erforderlich)
- Proxy (Erforderlich) — Wählen Sie Basic Proxy für die kostenlose Verarbeitung, Enhanced Proxy für zusätzliche 0,04 $ pro URL oder Auto, um zuerst Basic zu versuchen und automatisch zu Enhanced zu wechseln, wenn Basic fehlschlägt. Verfügbare Optionen: Basic Proxy - Kostenlos, Enhanced Proxy - Extra 0,04 $ pro URL, Auto - Zuerst Basic versuchen und bei Fehlschlag zu Enhanced wechseln.
- Cookies (Optional) — Fügen Sie optional Cookies für Seiten ein, die eine Anmeldung erfordern. Verwenden Sie in jeder Aufgabe nur Cookies von einer einzigen Website.
🚀 Anwendung
- Öffnen Sie die Vorlage und wählen Sie Ausprobieren oder Starten.
- Füllen Sie die oben aufgeführten Eingabefelder aus.
- Starten Sie die Aufgabe im unterstützten Cloud-Ausführungsmodus.
- Überprüfen Sie die Ausgabezeilen und exportieren oder verarbeiten Sie die strukturierten Daten.
⚠️ Einschränkungen
Die Ergebnisse hängen davon ab, was die Quellseite zur Laufzeit bereitstellt. Ein aufgeführtes Ausgabefeld kann leer sein, wenn die Quellseite diesen Wert nicht liefert. Die oben gezeigten Eingabegrenzen werden von der Vorlage erzwungen.
💡 Tipps
Verwenden Sie spezifische, gültige Eingaben und überprüfen Sie ein repräsentatives Ergebnis, bevor Sie eine große Charge starten. Entfernen Sie doppelte Eingaben, wenn wiederholte Datensätze nicht benötigt werden.
❓ FAQ
Wie sammelt Octoparse Daten von vom Benutzer bereitgestellten öffentlichen Webseiten?
Die Python-Automatisierung validiert jede Ziel-URL, übermittelt die Seite zusammen mit der benutzerdefinierten Feldspezifikation und den ausgewählten Proxy- oder Cookie-Einstellungen an den KI-Extraktionsdienst, wartet auf das Ergebnis und gibt den dynamisch geformten Datensatz zurück.
Welche Eingaben benötigt dieser KI-Scraper?
Verwenden Sie die im Abschnitt „Eingabe“ gezeigten Felder und akzeptierten Werte. Es werden nur für den Benutzer relevante Grenzwerte und auswählbare Optionen aufgeführt.
Welche Daten kann ich von vom Benutzer bereitgestellten öffentlichen Webseiten extrahieren?
Die aktuellen Ausgabefelder und eine repräsentative JSON-Datenvorschau sind im Abschnitt „Ausgabe“ aufgeführt. Die Verfügbarkeit von Feldern kann variieren, wenn die Quellseite einen Wert nicht anzeigt.
Ist die Nutzung dieses KI-Scrapers kostenlos?
Es gibt keine Nutzungsgebühr pro Zeile. Der Basic Proxy ist kostenlos, während der Enhanced Proxy zusätzlich 0,04 $ pro URL kostet. Im Auto-Modus versucht die Vorlage zuerst den Basic Proxy und wechselt nur dann zum Enhanced Proxy, wenn Basic fehlschlägt.
Warum können einige Felder von vom Benutzer bereitgestellten öffentlichen Webseiten leer sein?
Quellseiten stellen nicht immer jeden Wert für jeden Datensatz bereit, und Layouts können je nach Artikel, Markt oder aktueller Seitenantwort variieren. Die Vorlage gibt ein Feld zurück, wenn die aktuelle Seite es bereitstellt.
Kann ich die gesammelten Daten von vom Benutzer bereitgestellten öffentlichen Webseiten exportieren?
Sie können die strukturierten Zeilen in Octoparse überprüfen und sie mit den von Ihrer Octoparse-Umgebung unterstützten Optionen exportieren oder verarbeiten.
🔗 Verwandte Vorlagen
- AI Crawl — Verwenden Sie den Crawl-Workflow, wenn Seiten zuerst unter einer Start-Website entdeckt werden müssen.
- Universal Content Scraper — Verwenden Sie einen festen Content-Crawling-Workflow für die strukturierte Extraktion auf einer gesamten Website.
- Google Search Scraper — Verwenden Sie Google-Suchergebnis-URLs als Zielseiten für die benutzerdefinierte Extraktion.