pricewatch.io
Prijs toevoegen
Crawleridentiteit

De pricewatch.io-crawler

Als je deze URL in je serverlogs bent tegengekomen, legt deze pagina uit wat het verzoek was, wat het verzamelt en hoe je het stopt. Het meeste van wat pricewatch publiceert komt helemaal niet van crawlen: het komt uit officiële open-datafeeds die voor hergebruik zijn gepubliceerd.

De exacte User-Agent

Elk verzoek dat de fetcher doet draagt deze header, ongewijzigd. Beweert een verzoek pricewatch te zijn maar komt het niet exact met deze string overeen, dan zijn wij het niet.

User-Agent
pricewatch.io/1.0 (+https://pricewatch.io/bot)
Klik op het blok om alles te selecteren.

Wat hij doet

  • Haalt gepubliceerde prijsdata op van pagina's die voor elke bezoeker open staan.
  • Identificeert zich bij elk verzoek met de User-Agent hierboven.
  • Leest en volgt robots.txt, inclusief crawl-delay, voordat hij iets anders opvraagt.
  • Beperkt de snelheid per host, met één verzoek tegelijk en een pauze tussen verzoeken.
  • Trekt zich terug bij 429 en 503 in plaats van hard opnieuw te proberen, respecteert Retry-After en verruimt het interval bij herhaling.

Wat hij niet doet

  • Geen content achter een login. Hij heeft geen accounts en houdt voor geen enkele site inloggegevens.
  • Geen persoonsgegevens. Hij legt prijzen, verkopers, locaties en tijdstempels vast, niets over je gebruikers.
  • Geen poging om toegangscontrole te omzeilen: geen paywalls omzeilen, geen CAPTCHA's oplossen, geen roterende IP's of vervalste user agents.
  • Geen formulieren, geen afrekenprocessen, geen enkele schrijfactie. Hij doet uitsluitend GET-verzoeken.

Hoe je hem blokkeert

Voeg dit toe aan je robots.txt. De crawler leest robots.txt voor elke run opnieuw, dus een blokkade werkt bij het volgende bezoek, en er is geen verzoek of bevestiging van ons nodig.

robots.txt
User-agent: pricewatch.io
Disallow: /
Klik op het blok om alles te selecteren.

Blokkeren via robots.txt is genoeg. Blokkeren op User-Agent aan je edge werkt ook en daar gaan we niet omheen.

Een mens bereiken

Veroorzaakt de crawler belasting, heeft hij iets opgepakt dat niet mocht, of wil je hem gewoon weg zonder robots.txt aan te raken: schrijf ons en een persoon leest het. We beantwoorden elk bericht binnen twee werkdagen en we stoppen op verzoek met het ophalen van een host, zonder te vragen waarom.

abuse@pricewatch.io

De meeste data wordt niet gecrawld

Het grootste deel van wat pricewatch bevat komt binnen als open-datafeeds die door de bron zelf zijn gepubliceerd onder een licentie die hergebruik toestaat. Franse brandstofprijzen komen bijvoorbeeld van prix-carburants.gouv.fr onder Licence Ouverte 2.0: één geplande download in plaats van duizenden paginaverzoeken. Crawlen is de terugvaloptie voor bronnen zonder feed, en elke regel houdt zijn bron en licentie bij zich.