Cloud Web Scraping
Web-Datenextraktion mit Cloud-Extraktion automatisieren
Bei der Cloud-Extraktion laufen die in Octoparse erstellten Aufgaben nicht auf Ihrem lokalen PC, sondern auf den Cloud-Servern von Octoparse. So können Sie tägliche Preisüberwachung und die regelmäßige Extraktion von mehreren Websites betreiben, ohne Ihren Rechner eingeschaltet zu lassen.
Cloud-Extraktion und geplante Läufe sind ab dem Standard-Plan verfügbar.
Ablauf einer Cloud-Aufgabe
Der Ablauf nach der Einrichtung auf einen Blick
Zeitplan
Startet täglich um 09:00 Uhr
Cloud-Extraktion
Läuft ohne Ihren PC
Datenexport
Gespeichert und übergeben im passenden Format
Die tatsächliche Laufzeit und die Extraktionsergebnisse hängen von der Struktur der Zielwebsite, ihrem Antwortverhalten und Ihren Aufgabeneinstellungen ab.
Warum Cloud-Extraktion
Kontinuierliche Web-Datenextraktion, unabhängig von Ihrem PC
Wenn Aufgaben auf den Cloud-Servern von Octoparse laufen, hängt Ihre Datenextraktion nicht mehr davon ab, ob ein lokales Gerät verfügbar ist. Geplante Läufe, mehrere parallele Aufgaben und der automatische Export nach Abschluss greifen dabei ineinander.
PC AUS
Läuft, ohne Ihr lokales Gerät zu blockieren
Während eine Cloud-Extraktion läuft, müssen Sie Octoparse auf Ihrem lokalen PC nicht geöffnet lassen. Auch bei langen Läufen bleiben die Geräte Ihres Teams für andere Arbeiten frei.
24 Stunden
Aufgaben laufen in der Cloud weiter
Ihre eingerichteten Aufgaben laufen in der Cloud-Umgebung von Octoparse – unabhängig davon, ob Ihr PC eingeschaltet ist oder ob Ihr Firmennetzwerk verfügbar ist.
Minuten, Stunden, Tage
Geplante Läufe passend zur Aktualisierungsfrequenz
Legen Sie Zeitpläne im Minuten-, Stunden-, Tages-, Wochen- oder Monatsrhythmus fest und verfolgen Sie Änderungen bei Preisen, Standortdaten und mehr kontinuierlich.
Mehrere Aufgaben
Parallel betreiben, wenn Sie skalieren
Betreiben Sie Aufgaben für einzelne Zielwebsites parallel – im Rahmen der Läufe und der Anzahl an Cloud-Servern, die Ihr Plan enthält.
IP-Rotation
Cloud-IPs rotieren pro Teilaufgabe
Die Cloud-Extraktion nutzt Cloud-IPs von Octoparse statt der IP Ihres lokalen PCs. Die IPs rotieren pro Teilaufgabe und werden beim nächsten Lauf zufällig neu zugewiesen. Das senkt das Risiko, dass Ihre lokale IP wegen gebündelter Zugriffe eingeschränkt wird.
Im Abonnement enthaltene Cloud-Läufe
24h × 30d
Cloud-Extraktion den ganzen Monat betreiben
Ab dem Standard-Plan ist die Cloud-Extraktion Teil Ihres Monats- oder Jahresabonnements und wird nicht nach Laufzeit oder Datensätzen abgerechnet. Ihre Aufgaben können während der Vertragslaufzeit durchgehend laufen, ohne dass ein PC eingeschaltet bleibt.
Die Anzahl der verfügbaren Cloud-Server, gleichzeitigen Läufe und Aufgaben hängt vom Plan ab. Für einzelne Services, darunter bestimmte Vorlagen, können gesonderte Preise gelten.
So funktioniert die Cloud-Extraktion
Von der Einrichtung bis zu nutzbaren Daten in einem Ablauf
Vier Schritte decken alles ab, was Sie für den Start brauchen: Aufgabe erstellen, Laufumgebung einrichten, Cloud-Extraktion planen und Daten exportieren.
SCHRITT 01
Aufgabe erstellen
Sie können eine benutzerdefinierte Aufgabe erstellen, indem Sie Felder und Seitenaktionen selbst einrichten, oder mit einer fertigen Vorlage starten.
Zwei Wege zur Aufgabe
Benutzerdefinierte Aufgabe erstellen
Laden Sie die Ziel-URL und richten Sie Klicks, Paginierung, Login und die zu erfassenden Felder direkt am Bildschirm ein. So decken Sie auch komplexe Seiten und spezielle Anforderungen ab.
Mit einer Vorlage starten
Wählen Sie eine Vorlage für Ihre Zielwebsite, geben Sie Parameter wie Suchbegriffe oder Region ein und starten Sie sofort mit der Extraktion.
Gespeicherte Aufgaben lassen sich wiederverwenden. Im nächsten Schritt richten Sie Cloud-Läufe und wiederkehrende Zeitpläne ein.
Benutzerdefinierte Aufgabe 
Gelbe Seiten: Firmen- und KontaktdatenVorlage 
SCHRITT 02
Lauf einrichten
Bei benutzerdefinierten Aufgaben öffnen Sie vor dem Start die Laufeinstellungen und passen die Laufumgebung an, darunter den integrierten Browser und die Cloud-Server-Gruppe. Passend zur Zielwebsite wählen Sie eine Laufumgebung aus Cloud-Server-Gruppen in mehreren Ländern und Regionen. Aktivieren Sie die inkrementelle Extraktion, werden die bereits erfassten URLs verglichen, sodass nur neu hinzugekommene Seiten abgerufen werden. Der Vergleich erfolgt wahlweise über die vollständige URL oder über bestimmte URL-Parameter.
- Integrierten Browser und User-Agent passend zur Aufgabe einstellen
- Cloud-Server-Gruppen in mehreren Ländern und Regionen wählen
- Aufgabe aufteilen und parallel ausführen – je nach Anzahl der Cloud-Server in Ihrem Plan
- Mit inkrementeller Extraktion bereits erfasste URLs überspringen und nur neue Seiten abrufen
Laufumgebung und inkrementelle Extraktion in den Laufeinstellungen anpassen 
SCHRITT 03
Zeitplan festlegen
Wählen Sie die Aufgabe aus, öffnen Sie das Menü für geplante Läufe und legen Sie einen Zeitplan für die Cloud-Extraktion an. Stellen Sie Häufigkeit und Startzeit ein, und die Aufgabe läuft automatisch nach diesem Zeitplan in der Cloud.
Zeitplan für die Cloud-Extraktion anlegen 
Häufigkeit und Startzeit einstellen 
Einmalige Cloud-Extraktion
Wenn Sie ohne Zeitplan nur einmal ausführen möchten, wählen Sie beim Start der Aufgabe „Cloud-Extraktion“. Die Verarbeitung läuft auf den Cloud-Servern von Octoparse, sodass Ihr lokaler PC nicht belegt wird und die Aufgabe auch nach dem Herunterfahren weiterläuft.
„Cloud-Extraktion“ wählen und starten 
Einmalige und geplante Läufe über die CLI
Mit der Octoparse CLI starten Sie eine Aufgabe einmalig über die Kommandozeile und richten geplante Läufe über cron, CI/CD oder Ihren internen Job-Scheduler ein. Da das Timing im Scheduler liegt, laufen nächtliche Batches und regelmäßige Aktualisierungen, ohne dass jemand die Desktop-App öffnet.
Mehr über die CLI erfahrenSCHRITT 04
Speichern und anbinden
Exportieren Sie die extrahierten Daten direkt als Excel-, CSV-, JSON- und weitere Dateiformate auf Ihr Gerät. Ebenso möglich sind Google Sheets, Datenbanken sowie Cloud-Speicher wie Google Drive, Dropbox und Amazon S3. Richten Sie einen automatischen Export passend zu Ihrem Zeitplan ein, landen die Daten direkt nach Abschluss der Aufgabe am Zielort – bereit zum Prüfen, Teilen und Weiterverarbeiten.
Verfügbare Ziele und Funktionen für den automatischen Export hängen vom Plan ab.
Ziel und Format wählen 
Nach jedem Lauf automatisch exportierenEinstellungen ansehen
Kombinieren Sie Zeitpläne mit dem automatischen Export, um wiederkehrende Extraktion und Übergabe an Ihr Ziel in einem automatisierten Ablauf zu bündeln.
Festlegen, was automatisch exportiert wird 
Ziel und Exportformat festlegen 
Die passende Laufumgebung
Cloud-Extraktion, lokale Extraktion und Eigenbau im Vergleich
Welcher Weg passt, hängt davon ab, wie oft Sie Daten extrahieren, wie viel Zeit Sie für Wartung haben und wie weit Sie skalieren müssen. Flask ist eine Möglichkeit, Python-Logik über HTTP bereitzustellen – die Laufinfrastruktur wie ein VPS und deren Wartung bleiben bei Ihnen.
| Kriterium | Cloud-Extraktion mit Octoparse | Lokale Extraktion mit Octoparse | Selbst betriebenes Python (inkl. VPS und Flask) |
|---|---|---|---|
| Geeignet für | Regelmäßige Überwachung, mehrere Aufgaben, dauerhafter Betrieb ohne PC | Tests, kleine einmalige Läufe, Ergebnisse direkt prüfen | Eigene Logik oder tiefe Anbindung an interne Systeme |
| Programmierung | Grundsätzlich nicht erforderlich | Grundsätzlich nicht erforderlich | Design, Entwicklung und Tests erforderlich |
| Geplante Läufe | Zeitplanung in den unterstützten Plänen verfügbar | Abhängig davon, ob das Gerät läuft | Job-Verwaltung und Störungsbehebung bauen Sie selbst |
| Betrieb und Wartung | Sie konzentrieren sich auf Aufgabeneinstellungen und Ergebnisse | Sie prüfen Gerät, Netzwerk und Aufgabe selbst | Sie warten Code, Server, Abhängigkeiten und Monitoring |
| Skalierung | Mehrere Aufgaben im Rahmen der Läufe Ihres Plans betreiben | Begrenzt durch Geräteleistung und Laufzeit | Serverausbau und Ablaufsteuerung müssen geplant werden |
Wenn eine offizielle API die benötigten Daten und Aktualisierungsfrequenz abdeckt, prüfen Sie zuerst deren Nutzungsbedingungen. Python passt, wenn Sie eigene Verarbeitung fein steuern wollen; Octoparse passt, wenn Sie ohne Code kontinuierlich extrahieren möchten.
Einsatzbereiche
Für Aufgaben, bei denen Sie Aktualisierungen verfolgen
Je häufiger Sie dieselben Daten unter denselben Bedingungen prüfen, desto stärker zahlen sich Cloud-Extraktion und Zeitplanung aus.
Alle Vorlagen ansehenRegelmäßige Extraktion von Filialdaten
Extrahieren Sie Firmen- und Filialnamen, Adressen, Telefonnummern, Öffnungszeiten und Kategorien nach Region und Branche regelmäßig und behalten Sie Neueröffnungen und geänderte Einträge im Blick. Nützlich für die Pflege von Lead-Listen, Standortanalysen und Einzugsgebietsanalysen.
Vorlage für Filialdaten nutzenPreise und Lagerbestände im E-Commerce überwachen
Extrahieren Sie regelmäßig Preise, Lagerbestände und Bewertungen zu Wettbewerbs- und eigenen Produkten auf Amazon, eBay und weiteren E-Commerce-Plattformen, um Veränderungen zu verfolgen und historische Daten aufzubauen.
Vorlagen für E-Commerce ansehenSocial-Media-Beiträge, B2B-Angebote, Stellen und Immobilien verfolgen
Erfassen Sie fortlaufend dieselben Felder aus Beiträgen in sozialen Netzwerken, B2B-Angeboten von Lieferanten- und Großhandelsplattformen wie wlw.de, Stellenanzeigen und Immobilienangeboten und bringen Sie Struktur in die manuelle Prüfung im Team.
Passende Vorlage findenDaten aus mehreren Websites aufbauen
Teilen Sie Aufgaben nach Zielwebsite und Aktualisierungsfrequenz auf und sammeln Sie so die Datenbasis für Ihr wöchentliches oder monatliches Reporting und Ihre Marktanalysen.
Enterprise-Plan ansehenStabilität und Skalierung
Lange und umfangreiche Extraktion in der Cloud betreiben
In den unterstützten Plänen können Sie Aufgaben für parallele Läufe aufteilen und mehrere Aufgaben gleichzeitig betreiben. Statt alles auf ein Gerät zu legen, ordnen Sie Läufe nach Zielwebsite und Aktualisierungsfrequenz. Allerdings garantiert der Betrieb in der Cloud allein keine erfolgreiche Extraktion – planen Sie Ihre Abläufe deshalb so, dass Sie Ergebnisse prüfen können.
Vier Punkte für den dauerhaften Betrieb
- Aufgaben nach Zielwebsite und Aktualisierungsfrequenz trennen
- Lange Aufgaben in kleinere Bereiche aufteilen und zeitlich verteilen
- Datensatzzahlen, Lücken und Laufprotokolle regelmäßig prüfen
- Fehler und Timeouts prüfen, Ursache beheben und erneut ausführen
Prüfen Sie beim Web Scraping die Nutzungsbedingungen der Zielwebsite, ihre robots.txt, personenbezogene Daten, Urheberrechte und die von Ihnen erzeugte Zugriffslast.
Betriebsmonitoring
Laufstatus aller Aufgaben per API zusammenführen
In den unterstützten Plänen liefert die Task Performance Analytics API Laufzahlen, Erfolgsquoten, Datensatzzahlen und Ressourcenverbrauch nach Tag, Woche oder Monat. Binden Sie sie in Ihre Monitoring-Tools oder regelmäßigen Reports ein, um mehrere Aufgaben dauerhaft im Blick zu behalten.
Ein plötzlicher Rückgang bei Erfolgsquote oder Datensatzzahl ist ein guter Anlass zu prüfen, ob sich Struktur oder Zugriffsbedingungen der Zielwebsite geändert haben. Sehen Sie sich dann Laufprotokolle und Ergebnisse an und passen Sie die Aufgabe bei Bedarf an.
API-Referenz zur Aufgabenanalyse ansehenExport und Anbindung
Export in der Form, die Ihr nächster Schritt braucht
Wählen Sie den Weg, der zu Ihrem Ziel passt – Analyse auf dem eigenen Rechner, Austausch im Team oder Anbindung an ein bestehendes System. Verfügbare Ziele und Automatisierungsfunktionen hängen vom Plan ab.
Excel und CSV
Export in Formate, die sich in Tabellen gut bearbeiten und intern leicht teilen lassen.
JSON und XML
Formate für die Datenverarbeitung und die Übergabe an andere Tools.
Google Sheets
Befüllen Sie eine Tabelle, die Ihr Team prüfen und teilen kann.
API und Datenbanken
In den unterstützten Plänen binden Sie die Daten in bestehende Abläufe ein.
Cloud-Speicher
Export nach Google Drive, Dropbox, Amazon S3 und weiteren Zielen – zum Teilen und Weiterverarbeiten.
Cloud-Extraktion und geplante Läufe: häufige Fragen
Wiederkehrende Web-Datenextraktion automatisieren
Erstellen Sie zuerst eine Aufgabe und legen Sie fest, in welcher Frequenz und in welchem Datenformat Sie Ergebnisse brauchen. Wenn Sie Cloud-Extraktion und geplante Läufe nutzen möchten, prüfen Sie, welche Pläne diese enthalten.