Web scraping mag ook in Duitsland ingezet worden door bedrijven om data te verzamelen. Dat betekent niet dat alles wat online staat automatisch mag worden verzameld. Het maakt juridisch veel uit of een web scraper productprijzen bijhoudt of persoonlijke LinkedIn-profielen opslaat. Ook de manier waarop de data wordt verkregen telt mee. Een openbare productpagina bezoeken is iets anders dan een login, CAPTCHA of IP-blokkade omzeilen.
Wie openbare, niet-persoonsgebonden data verzamelt en technische grenzen respecteert, kan webscraping in Duitsland verantwoord inzetten als middel om concurrenten te volgen of om meer markt inzicht te krijgen. Hiervoor is het wel nodig dat de bronnen, datavelden en verzamelmethoden vooraf duidelijk zijn en tijdens het project worden bewaakt. Ook moet er niet meer worden gescraped dan nodig is.
Het juridische kader in Duitsland
DSGVO en privacy
De DSGVO is van toepassing zodra data iets zegt over een geïdentificeerde of identificeerbare natuurlijke persoon. Namen, persoonlijke e-mailadressen, telefoonnummers en profielen op sociale media vallen daar meestal onder. Vooral het combineren van losse databronnen kan gevoelig zijn. Eén openbaar profiel lijkt misschien onschuldig. Een database met duizenden profielen, functies, werkgevers en e-mailadressen heeft een heel ander karakter. Dat deze informatie openbaar zichtbaar is, maakt onbeperkt hergebruik niet automatisch toegestaan.
Auteursrecht en databankenrecht
Volgens §§ 87a en verder van het Duitse Urheberrechtsgesetz kan een databank beschermd zijn als de samenstelling, controle of presentatie ervan een aanzienlijke investering heeft gevraagd. Een enkele openbare productprijs verzamelen is iets anders dan vrijwel de volledige catalogus van een platform kopiëren. Hoe groter en systematischer de overname, hoe belangrijker het wordt om naar de databankrechten te kijken.
§ 44b UrhG biedt ruimte voor Text and Data Mining van bronnen waartoe rechtmatig toegang is verkregen. Kopieën moeten worden verwijderd zodra ze niet meer nodig zijn. Een rechthebbende kan het gebruik bovendien voorbehouden. Bij online werken moet zo’n voorbehoud machineleesbaar zijn vastgelegd. Deze regeling maakt data-analyse mogelijk, maar is geen algemene toestemming om commerciële databanken te kopiëren of opnieuw te publiceren.
UWG en oneerlijke concurrentie
Ook het Gesetz gegen den unlauteren Wettbewerb kan relevant zijn. Deze wet moet voorkomen dat bedrijven elkaar op een oneerlijke manier hinderen. Denk aan een bedrijf dat één concurrent volgt en middels dynamic pricing continue automatisch onder de prijs van dat ene bedrijf gaat zitten. Dat mag in Duitsland niet, beter zet je een marktvergelijking op waarbij de prijzen van meerdere aanbieders op een beperkte en proportionele manier worden gevolgd.
Prijsmonitoring is dus niet automatisch verboden. De omvang, het doel en de manier waarop de verzamelde data wordt gebruikt, bepalen mede hoe de activiteit juridisch wordt beoordeeld.
§ 202a StGB en technische beveiliging
§ 202a van het Duitse Strafgesetzbuch beschermt data die speciaal tegen onbevoegde toegang is beveiligd. Wie zonder toestemming een toegangsbeveiliging doorbreekt, kan strafbaar handelen.
Openbare toegankelijkheid
Een belangrijk uitgangspunt is dat de bron openbaar moet zijn. De data moet zonder account, abonnement of technische truc kunnen worden bekeken. Ook gebruiksvoorwaarden, robots.txt-instructies en machineleesbare gebruiksvoorbehouden kunnen relevant zijn.
Een productpagina laat dat verschil goed zien. De prijs, voorraadstatus en productspecificaties zijn doorgaans zakelijke data. Op dezelfde pagina kunnen ook klantreviews staan. Bij Managed web scraping nemen we niet alles mee wat technisch beschikbaar is. Alleen de afgesproken datavelden worden verwerkt.
Is de data persoonsgebonden?
Ons datamodel is bewust gericht op zakelijke informatie:
| Datatype | Persoonsgebonden? | Wat wij doen |
|---|---|---|
| Productprijzen | Nee | Verzamelen wij wel |
| Bedrijfsomschrijvingen | Doorgaans niet | Verzamelen wij wel |
| LinkedIn-profielen | Ja | Verzamelen wij niet |
| E-mailadressen | Vaak wel | Verzamelen wij niet |
Productprijzen, assortimenten, beschikbaarheid en technische productkenmerken zijn normaal gesproken niet aan een natuurlijke persoon gekoppeld. Deze data kan worden gebruikt voor prijsmonitoring, marktonderzoek en Business Intelligence.
LinkedIn-profielen en e-mailadressen sluiten wij uit. Een openbaar profiel blijft persoonsgebonden, ook als het zonder login zichtbaar is. Hetzelfde geldt vaak voor zakelijke e-mailadressen waarin de volledige naam van een medewerker staat.
Door zulke bronnen en datavelden vanaf het begin uit te sluiten, voorkomen we dat persoonsdata ongemerkt in een grotere dataset terechtkomt.
Een verantwoorde verzamelmethode
Een juridisch zorgvuldige aanpak moet ook technisch netjes zijn. De scraper wordt zo geconfigureerd dat alleen de data die voor het afgesproken doel nodig is wordt verzameld. De scraping wordt daarnaast ethisch ingesteld zodat de target server geen last heeft van het scrapen. In de WSA Bot manager is vastgelegd welke bronnen worden gebruikt en welke datavelden worden opgeslagen. Er wordt niet meer gescraped dan nodig is.
Managed Web Scraping als gecontroleerde geautomatiseerde dataservice
Managed Web Scraping brengt het verzamelen, controleren, monitoren, onderhouden en leveren van data samen. Onze grens is duidelijk: we verzamelen openbare product- en bedrijfsdata. Zo kunnen Duitse bedrijven webdata gebruiken voor prijsanalyses, marktmonitoring en strategische beslissingen, zonder ongemerkt een database met persoonsdata op te bouwen.

