logo
languageDEdown
menu

Cloud Web Scraping

Web-Datenextraktion mit Cloud-Extraktion automatisieren

Bei der Cloud-Extraktion laufen die in Octoparse erstellten Aufgaben nicht auf Ihrem lokalen PC, sondern auf den Cloud-Servern von Octoparse. So können Sie tägliche Preisüberwachung und die regelmäßige Extraktion von mehreren Websites betreiben, ohne Ihren Rechner eingeschaltet zu lassen.

So funktioniert es

Cloud-Extraktion und geplante Läufe sind ab dem Standard-Plan verfügbar.

Ablauf einer Cloud-Aufgabe

Der Ablauf nach der Einrichtung auf einen Blick

Läuft

Zeitplan

Startet täglich um 09:00 Uhr

Aktiviert

Cloud-Extraktion

Läuft ohne Ihren PC

Datenexport

Gespeichert und übergeben im passenden Format

Die tatsächliche Laufzeit und die Extraktionsergebnisse hängen von der Struktur der Zielwebsite, ihrem Antwortverhalten und Ihren Aufgabeneinstellungen ab.

Warum Cloud-Extraktion

Kontinuierliche Web-Datenextraktion, unabhängig von Ihrem PC

Wenn Aufgaben auf den Cloud-Servern von Octoparse laufen, hängt Ihre Datenextraktion nicht mehr davon ab, ob ein lokales Gerät verfügbar ist. Geplante Läufe, mehrere parallele Aufgaben und der automatische Export nach Abschluss greifen dabei ineinander.

PC AUS

Läuft, ohne Ihr lokales Gerät zu blockieren

Während eine Cloud-Extraktion läuft, müssen Sie Octoparse auf Ihrem lokalen PC nicht geöffnet lassen. Auch bei langen Läufen bleiben die Geräte Ihres Teams für andere Arbeiten frei.

24 Stunden

Aufgaben laufen in der Cloud weiter

Ihre eingerichteten Aufgaben laufen in der Cloud-Umgebung von Octoparse – unabhängig davon, ob Ihr PC eingeschaltet ist oder ob Ihr Firmennetzwerk verfügbar ist.

Minuten, Stunden, Tage

Geplante Läufe passend zur Aktualisierungsfrequenz

Legen Sie Zeitpläne im Minuten-, Stunden-, Tages-, Wochen- oder Monatsrhythmus fest und verfolgen Sie Änderungen bei Preisen, Standortdaten und mehr kontinuierlich.

Mehrere Aufgaben

Parallel betreiben, wenn Sie skalieren

Betreiben Sie Aufgaben für einzelne Zielwebsites parallel – im Rahmen der Läufe und der Anzahl an Cloud-Servern, die Ihr Plan enthält.

IP-Rotation

Cloud-IPs rotieren pro Teilaufgabe

Die Cloud-Extraktion nutzt Cloud-IPs von Octoparse statt der IP Ihres lokalen PCs. Die IPs rotieren pro Teilaufgabe und werden beim nächsten Lauf zufällig neu zugewiesen. Das senkt das Risiko, dass Ihre lokale IP wegen gebündelter Zugriffe eingeschränkt wird.

Im Abonnement enthaltene Cloud-Läufe

24h × 30d

Cloud-Extraktion den ganzen Monat betreiben

Ab dem Standard-Plan ist die Cloud-Extraktion Teil Ihres Monats- oder Jahresabonnements und wird nicht nach Laufzeit oder Datensätzen abgerechnet. Ihre Aufgaben können während der Vertragslaufzeit durchgehend laufen, ohne dass ein PC eingeschaltet bleibt.

Die Anzahl der verfügbaren Cloud-Server, gleichzeitigen Läufe und Aufgaben hängt vom Plan ab. Für einzelne Services, darunter bestimmte Vorlagen, können gesonderte Preise gelten.

Preise ansehen

So funktioniert die Cloud-Extraktion

Von der Einrichtung bis zu nutzbaren Daten in einem Ablauf

Vier Schritte decken alles ab, was Sie für den Start brauchen: Aufgabe erstellen, Laufumgebung einrichten, Cloud-Extraktion planen und Daten exportieren.

  1. SCHRITT 01

    Aufgabe erstellen

    Sie können eine benutzerdefinierte Aufgabe erstellen, indem Sie Felder und Seitenaktionen selbst einrichten, oder mit einer fertigen Vorlage starten.

    Zwei Wege zur Aufgabe

    • Benutzerdefinierte Aufgabe erstellen

      Laden Sie die Ziel-URL und richten Sie Klicks, Paginierung, Login und die zu erfassenden Felder direkt am Bildschirm ein. So decken Sie auch komplexe Seiten und spezielle Anforderungen ab.

    • Mit einer Vorlage starten

      Wählen Sie eine Vorlage für Ihre Zielwebsite, geben Sie Parameter wie Suchbegriffe oder Region ein und starten Sie sofort mit der Extraktion.

    Gespeicherte Aufgaben lassen sich wiederverwenden. Im nächsten Schritt richten Sie Cloud-Läufe und wiederkehrende Zeitpläne ein.

    Benutzerdefinierte Aufgabe
    Ein mit einer benutzerdefinierten Aufgabe in Octoparse erstellter Workflow zur Datenextraktion
    Gelbe Seiten: Firmen- und KontaktdatenVorlage
    Der Vorlagenbildschirm des Gelbe-Seiten-Scrapers für Firmen- und Kontaktdaten
  2. SCHRITT 02

    Lauf einrichten

    Bei benutzerdefinierten Aufgaben öffnen Sie vor dem Start die Laufeinstellungen und passen die Laufumgebung an, darunter den integrierten Browser und die Cloud-Server-Gruppe. Passend zur Zielwebsite wählen Sie eine Laufumgebung aus Cloud-Server-Gruppen in mehreren Ländern und Regionen. Aktivieren Sie die inkrementelle Extraktion, werden die bereits erfassten URLs verglichen, sodass nur neu hinzugekommene Seiten abgerufen werden. Der Vergleich erfolgt wahlweise über die vollständige URL oder über bestimmte URL-Parameter.

    • Integrierten Browser und User-Agent passend zur Aufgabe einstellen
    • Cloud-Server-Gruppen in mehreren Ländern und Regionen wählen
    • Aufgabe aufteilen und parallel ausführen – je nach Anzahl der Cloud-Server in Ihrem Plan
    • Mit inkrementeller Extraktion bereits erfasste URLs überspringen und nur neue Seiten abrufen
    Laufumgebung und inkrementelle Extraktion in den Laufeinstellungen anpassen
    Der Bildschirm mit den Laufeinstellungen einer benutzerdefinierten Aufgabe für integrierten Browser, Cloud-Server-Gruppen und inkrementelle Extraktion
  3. SCHRITT 03

    Zeitplan festlegen

    Wählen Sie die Aufgabe aus, öffnen Sie das Menü für geplante Läufe und legen Sie einen Zeitplan für die Cloud-Extraktion an. Stellen Sie Häufigkeit und Startzeit ein, und die Aufgabe läuft automatisch nach diesem Zeitplan in der Cloud.

    Zeitplan für die Cloud-Extraktion anlegen
    Anlegen eines Zeitplans für die Cloud-Extraktion über das Menü für geplante Läufe einer Aufgabe
    Häufigkeit und Startzeit einstellen
    Einstellen eines Zeitplans für die Cloud-Extraktion in der Octoparse-Desktop-App

    Einmalige Cloud-Extraktion

    Wenn Sie ohne Zeitplan nur einmal ausführen möchten, wählen Sie beim Start der Aufgabe „Cloud-Extraktion“. Die Verarbeitung läuft auf den Cloud-Servern von Octoparse, sodass Ihr lokaler PC nicht belegt wird und die Aufgabe auch nach dem Herunterfahren weiterläuft.

    „Cloud-Extraktion“ wählen und starten
    Auswahl zwischen lokaler Extraktion und Cloud-Extraktion für einen einmaligen Lauf

    Einmalige und geplante Läufe über die CLI

    Mit der Octoparse CLI starten Sie eine Aufgabe einmalig über die Kommandozeile und richten geplante Läufe über cron, CI/CD oder Ihren internen Job-Scheduler ein. Da das Timing im Scheduler liegt, laufen nächtliche Batches und regelmäßige Aktualisierungen, ohne dass jemand die Desktop-App öffnet.

    Mehr über die CLI erfahren
  4. SCHRITT 04

    Speichern und anbinden

    Exportieren Sie die extrahierten Daten direkt als Excel-, CSV-, JSON- und weitere Dateiformate auf Ihr Gerät. Ebenso möglich sind Google Sheets, Datenbanken sowie Cloud-Speicher wie Google Drive, Dropbox und Amazon S3. Richten Sie einen automatischen Export passend zu Ihrem Zeitplan ein, landen die Daten direkt nach Abschluss der Aufgabe am Zielort – bereit zum Prüfen, Teilen und Weiterverarbeiten.

    Verfügbare Ziele und Funktionen für den automatischen Export hängen vom Plan ab.

    Ziel und Format wählen
    Der Datenexport-Bildschirm von Octoparse mit Optionen für Excel, CSV, Datenbanken und Cloud-Speicher
    Nach jedem Lauf automatisch exportierenEinstellungen ansehen

    Kombinieren Sie Zeitpläne mit dem automatischen Export, um wiederkehrende Extraktion und Übergabe an Ihr Ziel in einem automatisierten Ablauf zu bündeln.

    Festlegen, was automatisch exportiert wird
    Einrichten der Ziele für den automatischen Export von Cloud-Daten und lokalen Daten
    Ziel und Exportformat festlegen
    Einrichten eines Cloud-Speicherziels und des Exportformats

Die passende Laufumgebung

Cloud-Extraktion, lokale Extraktion und Eigenbau im Vergleich

Welcher Weg passt, hängt davon ab, wie oft Sie Daten extrahieren, wie viel Zeit Sie für Wartung haben und wie weit Sie skalieren müssen. Flask ist eine Möglichkeit, Python-Logik über HTTP bereitzustellen – die Laufinfrastruktur wie ein VPS und deren Wartung bleiben bei Ihnen.

KriteriumCloud-Extraktion mit OctoparseLokale Extraktion mit OctoparseSelbst betriebenes Python (inkl. VPS und Flask)
Geeignet fürRegelmäßige Überwachung, mehrere Aufgaben, dauerhafter Betrieb ohne PCTests, kleine einmalige Läufe, Ergebnisse direkt prüfenEigene Logik oder tiefe Anbindung an interne Systeme
ProgrammierungGrundsätzlich nicht erforderlichGrundsätzlich nicht erforderlichDesign, Entwicklung und Tests erforderlich
Geplante LäufeZeitplanung in den unterstützten Plänen verfügbarAbhängig davon, ob das Gerät läuftJob-Verwaltung und Störungsbehebung bauen Sie selbst
Betrieb und WartungSie konzentrieren sich auf Aufgabeneinstellungen und ErgebnisseSie prüfen Gerät, Netzwerk und Aufgabe selbstSie warten Code, Server, Abhängigkeiten und Monitoring
SkalierungMehrere Aufgaben im Rahmen der Läufe Ihres Plans betreibenBegrenzt durch Geräteleistung und LaufzeitServerausbau und Ablaufsteuerung müssen geplant werden

Wenn eine offizielle API die benötigten Daten und Aktualisierungsfrequenz abdeckt, prüfen Sie zuerst deren Nutzungsbedingungen. Python passt, wenn Sie eigene Verarbeitung fein steuern wollen; Octoparse passt, wenn Sie ohne Code kontinuierlich extrahieren möchten.

Einsatzbereiche

Für Aufgaben, bei denen Sie Aktualisierungen verfolgen

Je häufiger Sie dieselben Daten unter denselben Bedingungen prüfen, desto stärker zahlen sich Cloud-Extraktion und Zeitplanung aus.

Alle Vorlagen ansehen
01 / Filial- und Firmendaten

Regelmäßige Extraktion von Filialdaten

Extrahieren Sie Firmen- und Filialnamen, Adressen, Telefonnummern, Öffnungszeiten und Kategorien nach Region und Branche regelmäßig und behalten Sie Neueröffnungen und geänderte Einträge im Blick. Nützlich für die Pflege von Lead-Listen, Standortanalysen und Einzugsgebietsanalysen.

Vorlage für Filialdaten nutzen
02 / E-Commerce und Handel

Preise und Lagerbestände im E-Commerce überwachen

Extrahieren Sie regelmäßig Preise, Lagerbestände und Bewertungen zu Wettbewerbs- und eigenen Produkten auf Amazon, eBay und weiteren E-Commerce-Plattformen, um Veränderungen zu verfolgen und historische Daten aufzubauen.

Vorlagen für E-Commerce ansehen
03 / Beiträge und Anzeigen

Social-Media-Beiträge, B2B-Angebote, Stellen und Immobilien verfolgen

Erfassen Sie fortlaufend dieselben Felder aus Beiträgen in sozialen Netzwerken, B2B-Angeboten von Lieferanten- und Großhandelsplattformen wie wlw.de, Stellenanzeigen und Immobilienangeboten und bringen Sie Struktur in die manuelle Prüfung im Team.

Passende Vorlage finden
04 / Recherche und Analyse

Daten aus mehreren Websites aufbauen

Teilen Sie Aufgaben nach Zielwebsite und Aktualisierungsfrequenz auf und sammeln Sie so die Datenbasis für Ihr wöchentliches oder monatliches Reporting und Ihre Marktanalysen.

Enterprise-Plan ansehen

Stabilität und Skalierung

Lange und umfangreiche Extraktion in der Cloud betreiben

In den unterstützten Plänen können Sie Aufgaben für parallele Läufe aufteilen und mehrere Aufgaben gleichzeitig betreiben. Statt alles auf ein Gerät zu legen, ordnen Sie Läufe nach Zielwebsite und Aktualisierungsfrequenz. Allerdings garantiert der Betrieb in der Cloud allein keine erfolgreiche Extraktion – planen Sie Ihre Abläufe deshalb so, dass Sie Ergebnisse prüfen können.

Vier Punkte für den dauerhaften Betrieb

  • Aufgaben nach Zielwebsite und Aktualisierungsfrequenz trennen
  • Lange Aufgaben in kleinere Bereiche aufteilen und zeitlich verteilen
  • Datensatzzahlen, Lücken und Laufprotokolle regelmäßig prüfen
  • Fehler und Timeouts prüfen, Ursache beheben und erneut ausführen

Prüfen Sie beim Web Scraping die Nutzungsbedingungen der Zielwebsite, ihre robots.txt, personenbezogene Daten, Urheberrechte und die von Ihnen erzeugte Zugriffslast.

Betriebsmonitoring

Laufstatus aller Aufgaben per API zusammenführen

In den unterstützten Plänen liefert die Task Performance Analytics API Laufzahlen, Erfolgsquoten, Datensatzzahlen und Ressourcenverbrauch nach Tag, Woche oder Monat. Binden Sie sie in Ihre Monitoring-Tools oder regelmäßigen Reports ein, um mehrere Aufgaben dauerhaft im Blick zu behalten.

Laufzahl und ErfolgsquoteEntwicklung der DatensatzzahlenRessourcenverbrauch

Ein plötzlicher Rückgang bei Erfolgsquote oder Datensatzzahl ist ein guter Anlass zu prüfen, ob sich Struktur oder Zugriffsbedingungen der Zielwebsite geändert haben. Sehen Sie sich dann Laufprotokolle und Ergebnisse an und passen Sie die Aufgabe bei Bedarf an.

API-Referenz zur Aufgabenanalyse ansehen

Export und Anbindung

Export in der Form, die Ihr nächster Schritt braucht

Wählen Sie den Weg, der zu Ihrem Ziel passt – Analyse auf dem eigenen Rechner, Austausch im Team oder Anbindung an ein bestehendes System. Verfügbare Ziele und Automatisierungsfunktionen hängen vom Plan ab.

Pläne und Funktionen ansehen
01

Excel und CSV

Export in Formate, die sich in Tabellen gut bearbeiten und intern leicht teilen lassen.

02

JSON und XML

Formate für die Datenverarbeitung und die Übergabe an andere Tools.

03

Google Sheets

Befüllen Sie eine Tabelle, die Ihr Team prüfen und teilen kann.

04

API und Datenbanken

In den unterstützten Plänen binden Sie die Daten in bestehende Abläufe ein.

05

Cloud-Speicher

Export nach Google Drive, Dropbox, Amazon S3 und weiteren Zielen – zum Teilen und Weiterverarbeiten.

Cloud-Extraktion und geplante Läufe: häufige Fragen

Wiederkehrende Web-Datenextraktion automatisieren

Erstellen Sie zuerst eine Aufgabe und legen Sie fest, in welcher Frequenz und in welchem Datenformat Sie Ergebnisse brauchen. Wenn Sie Cloud-Extraktion und geplante Läufe nutzen möchten, prüfen Sie, welche Pläne diese enthalten.

Preise ansehen