SammlerBot

This page in English ↓

SammlerBot er en webcrawler drevet av «Toralv Berge / dama.no». Denne siden forklarer hva den gjør, og hvordan du reserverer nettstedet ditt mot den.

Kontakt: sammlerbot@me.dama.no

Hva den gjør, og hvorfor

SammlerBot henter offentlig tilgjengelig tekst som brukes til å trene og finjustere språkmodeller (LLM-er). Innholdet lagres internt og videredistribueres ikke.

Slik kjenner du den igjen

User-Agent: SammlerBot/<versjon> (+https://bot.dama.no/SammlerBot)

Vi crawler under denne ene identiteten. Vi utgir oss aldri for å være en nettleser eller en annen bot, og vi bytter aldri identitet for å omgå sperrer. Trafikken kommer fra IP-addresser i AS224.

Slik reserverer du deg

robots.txt — det raskeste og mest presise:

User-agent: SammlerBot
Disallow: /

En Disallow for * respekteres på samme måte. Vi følger RFC 9309 fullt ut, inkludert Allow-presedens og Crawl-delay.

Andre signaler vi respekterer — alle disse gir samme resultat:

SignalVirkning
X-Robots-Tag-header eller <meta name="robots"> med noai, noimageai eller noindexDokumentet hentes ikke og inngår ikke i korpuset
tdm-reservation: 1 (header) eller /.well-known/tdmrep.jsonReservasjon etter DSM-direktivet art. 4 — respekteres
ai.txt eller tilsvarende fil som begrenser bruk til AI-treningDomenet crawles ikke
HTTP 401/402/403Nekting av tilgang — vi forsøker ikke på nytt med annen identitet
Innlogging, betalingsmur eller CAPTCHAVi henter aldri innhold bak autentisering, og løser aldri utfordringer

E-post — send en melding til sammlerbot@me.dama.no med domenet ditt. Vi legger det i sperrelisten manuelt, og du trenger ikke oppgi noen grunn. Vi bekrefter innen noen virkedager.

Hva som skjer med innhold vi allerede har hentet

Reservasjoner virker bakover. En fast jobb sjekker signalene på nytt for alle domener i korpuset, og har et domene reservert seg siden vi hentet innholdet, slettes alt innhold derfra — både råkopier og bearbeidet tekst. Det samme skjer når du ber om det på e-post. Slettingen loggføres.

Belastning

Maks én forespørsel i sekundet per domene, én tilkobling om gangen. Crawl-delay og Retry-After overstyrer når de er strengere, og gjentatte 429/503-svar setter domenet i karantene. Opplever du likevel at SammlerBot belaster nettstedet ditt, si fra — vi senker farten.

Hva vi ikke henter

Reglene over er ikke retningslinjer, men et bindende dokument crawleren er bygget rundt. All nettverkstilgang går gjennom én policy-port, og den svarer nei som standardsvar.


SammlerBot (English)

SammlerBot is a web crawler operated by «Toralv Berge / dama.no». This page explains what it does and how to opt your site out of it.

Contact: sammlerbot@me.dama.no

What it does, and why

SammlerBot collects publicly available text used to train and fine-tune large language models (LLMs). Collected content is stored internally and is not redistributed.

How to recognise it

User-Agent: SammlerBot/<version> (+https://bot.dama.no/SammlerBot)

We crawl under this single identity. We never impersonate browsers or other bots, and never rotate identities to get around a block. Traffic originates from IP addresses in AS224.

How to opt out

robots.txt — fastest and most precise:

User-agent: SammlerBot
Disallow: /

A Disallow for * is honored the same way. We follow RFC 9309 in full, including Allow precedence and Crawl-delay.

Other signals we honor — any one of these has the same effect:

SignalEffect
X-Robots-Tag header or <meta name="robots"> with noai, noimageai or noindexThe document is not fetched and never enters the corpus
tdm-reservation: 1 (header) or /.well-known/tdmrep.jsonDSM directive art. 4 reservation — honored
ai.txt or an equivalent file restricting AI-training useThe domain is not crawled
HTTP 401/402/403A refusal — we do not retry under a different identity
Login walls, paywalls or CAPTCHAsWe never fetch behind authentication and never solve challenges

Email — write to sammlerbot@me.dama.no with your domain. We add it to the deny list manually, and you do not need to give a reason. We confirm within a few working days.

What happens to content we have already collected

Opt-outs apply retroactively. A scheduled job re-checks these signals for every domain in the corpus; if a source has opted out since we harvested it, all of its content is deleted — both raw copies and processed text. The same happens when you ask by email. Deletions are logged.

Load

At most one request per second per domain, one connection at a time. Crawl-delay and Retry-After override that when stricter, and repeated 429/503 responses put the domain in cooldown. If SammlerBot is still causing you trouble, tell us and we will slow down.

What we do not collect

The rules above are not guidelines but a binding document the crawler is built around. All network access goes through a single policy gate, and its default answer is no.