SammlerBot
SammlerBot er en webcrawler drevet av «Toralv Berge / dama.no». Denne siden forklarer hva den
gjør, og hvordan du reserverer nettstedet ditt mot den.
Kontakt: sammlerbot@me.dama.no
Hva den gjør, og hvorfor
SammlerBot henter offentlig tilgjengelig tekst som brukes til å trene og finjustere språkmodeller (LLM-er). Innholdet lagres internt og videredistribueres ikke.
Slik kjenner du den igjen
User-Agent: SammlerBot/<versjon> (+https://bot.dama.no/SammlerBot)
Vi crawler under denne ene identiteten. Vi utgir oss aldri for å være en nettleser eller en annen bot, og vi bytter aldri identitet for å omgå sperrer. Trafikken kommer fra IP-addresser i AS224.
Slik reserverer du deg
robots.txt — det raskeste og mest presise:
User-agent: SammlerBot
Disallow: /
En Disallow for * respekteres på samme måte. Vi følger RFC 9309 fullt ut, inkludert
Allow-presedens og Crawl-delay.
Andre signaler vi respekterer — alle disse gir samme resultat:
| Signal | Virkning |
|---|---|
X-Robots-Tag-header eller <meta name="robots"> med noai, noimageai eller noindex | Dokumentet hentes ikke og inngår ikke i korpuset |
tdm-reservation: 1 (header) eller /.well-known/tdmrep.json | Reservasjon etter DSM-direktivet art. 4 — respekteres |
ai.txt eller tilsvarende fil som begrenser bruk til AI-trening | Domenet crawles ikke |
| HTTP 401/402/403 | Nekting av tilgang — vi forsøker ikke på nytt med annen identitet |
| Innlogging, betalingsmur eller CAPTCHA | Vi henter aldri innhold bak autentisering, og løser aldri utfordringer |
E-post — send en melding til sammlerbot@me.dama.no med domenet ditt. Vi legger det i sperrelisten manuelt, og du trenger ikke oppgi noen grunn. Vi bekrefter innen noen virkedager.
Hva som skjer med innhold vi allerede har hentet
Reservasjoner virker bakover. En fast jobb sjekker signalene på nytt for alle domener i korpuset, og har et domene reservert seg siden vi hentet innholdet, slettes alt innhold derfra — både råkopier og bearbeidet tekst. Det samme skjer når du ber om det på e-post. Slettingen loggføres.
Belastning
Maks én forespørsel i sekundet per domene, én tilkobling om gangen. Crawl-delay og
Retry-After overstyrer når de er strengere, og gjentatte 429/503-svar setter domenet i
karantene. Opplever du likevel at SammlerBot belaster nettstedet ditt, si fra — vi
senker farten.
Hva vi ikke henter
- Nettsteder som ikke står på en manuelt godkjent liste. Vi crawler ikke det åpne nettet; et domene vi ikke har gjennomgått, kontaktes ikke i det hele tatt.
- Kilder som i hovedsak består av personopplysninger — private profiler, lukkede forum, lekkede data — uansett om de er teknisk tilgjengelige.
Reglene over er ikke retningslinjer, men et bindende dokument crawleren er bygget rundt. All nettverkstilgang går gjennom én policy-port, og den svarer nei som standardsvar.
SammlerBot (English)
SammlerBot is a web crawler operated by «Toralv Berge / dama.no». This page explains what it
does and how to opt your site out of it.
Contact: sammlerbot@me.dama.no
What it does, and why
SammlerBot collects publicly available text used to train and fine-tune large language models (LLMs). Collected content is stored internally and is not redistributed.
How to recognise it
User-Agent: SammlerBot/<version> (+https://bot.dama.no/SammlerBot)
We crawl under this single identity. We never impersonate browsers or other bots, and never rotate identities to get around a block. Traffic originates from IP addresses in AS224.
How to opt out
robots.txt — fastest and most precise:
User-agent: SammlerBot
Disallow: /
A Disallow for * is honored the same way. We follow RFC 9309 in full, including
Allow precedence and Crawl-delay.
Other signals we honor — any one of these has the same effect:
| Signal | Effect |
|---|---|
X-Robots-Tag header or <meta name="robots"> with noai, noimageai or noindex | The document is not fetched and never enters the corpus |
tdm-reservation: 1 (header) or /.well-known/tdmrep.json | DSM directive art. 4 reservation — honored |
ai.txt or an equivalent file restricting AI-training use | The domain is not crawled |
| HTTP 401/402/403 | A refusal — we do not retry under a different identity |
| Login walls, paywalls or CAPTCHAs | We never fetch behind authentication and never solve challenges |
Email — write to sammlerbot@me.dama.no with your domain. We add it to the deny list manually, and you do not need to give a reason. We confirm within a few working days.
What happens to content we have already collected
Opt-outs apply retroactively. A scheduled job re-checks these signals for every domain in the corpus; if a source has opted out since we harvested it, all of its content is deleted — both raw copies and processed text. The same happens when you ask by email. Deletions are logged.
Load
At most one request per second per domain, one connection at a time. Crawl-delay and
Retry-After override that when stricter, and repeated 429/503 responses put the domain
in cooldown. If SammlerBot is still causing you trouble, tell us and we will slow down.
What we do not collect
- Sites that are not on a manually reviewed allow-list. We do not crawl the open web; a domain we have not reviewed is never contacted at all.
- Sources that are primarily personal data — private profiles, closed forums, leaked datasets — regardless of technical accessibility.
The rules above are not guidelines but a binding document the crawler is built around. All network access goes through a single policy gate, and its default answer is no.