Tillåta eller blockera AI-crawlers? Avvägningen
Beslutet förs oftast som en principfråga och är en affärsfråga: den som tjänar pengar på innehåll förlorar på att tillåta. Den som vinner uppdrag genom innehåll förlorar på att blockera – och det mer.
Det viktigaste
- Det finns två sorters åtkomst: förutseende insamlare och hämtningar i stunden. De går att styra var för sig – och just däri ligger den mest användbara lösningen.
- Den som säljer uppdrag bör i vilket fall tillåta hämtningarna i stunden: de skapar omnämnanden hos människor mitt i sökandet efter en lösning.
- Den som säljer innehåll eller tjänar på annonsvisningar har goda skäl att spärra insamlarna.
- robots.txt är en begäran, ingen spärr. Den som vill genomdriva tekniskt behöver en spärr på servernivå.
De båda sorternas åtkomst
Förutseende insamlare
Hämtar innehåll oberoende av en konkret fråga – för träning eller för ett eget sökindex. Exempel: GPTBot, PerplexityBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot.
Nytta för er: medelbar – innehållet står till förfogande i ett index. Kostnad: innehållet används utan att någon besöker er sida.
Hämtningar i stunden
Hämtar en sida i det ögonblick då någon har ställt en passande fråga. Exempel: OAI-SearchBot, ChatGPT-User, Perplexity-User, Claude-User.
Nytta för er: omedelbar – därur uppstår omnämnanden och länkar i konkreta svar. Kostnad: praktiskt taget ingen.
Visste du att…?
Den som schablonmässigt spärrar «alla AI-robotar» spärrar båda sorterna – och förlorar därmed just den del som är till nytta. Omnämnandet som källa i ett svar förutsätter att sidan får hämtas i stunden.
För ett företag som säljer uppdrag är det det sämsta tänkbara bytet: man förhindrar en rekommendation till någon mitt i sökandet efter en lösning, för att förhindra att en modell lär sig av ett offentligt tillgängligt fackinlägg.
Tre strategier
| Strategi | Insamlare | Hämtningar i stunden | Passar |
|---|---|---|---|
| Öppen | tillåta | tillåta | tjänsteföretag, B2B, rådgivning |
| Blandad | spärra | tillåta | förlag, kursleverantörer, fackmedier |
| Sluten | spärra | spärra | betalinnehåll, skyddade områden |
För de flesta små och medelstora företag är «öppen» det rätta valet. Den blandade strategin är den rimliga medelvägen för alla vars innehåll självt är produkten.
Filen robots.txt
För den öppna strategin med uttryckligt omnämnande – det är inte tvingande nödvändigt, men gör beslutet synligt och dokumenterar det:
User-agent: GPTBot Allow: / User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: PerplexityBot Allow: / User-agent: Perplexity-User Allow: / User-agent: ClaudeBot Allow: / User-agent: Claude-User Allow: / User-agent: Google-Extended Allow: / User-agent: Applebot-Extended Allow: / User-agent: * Allow: / Sitemap: https://example.com/sitemap.xml
För den blandade strategin spärras insamlarna och hämtningarna i stunden tillåts:
User-agent: GPTBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: PerplexityBot Disallow: / User-agent: Google-Extended Disallow: / User-agent: Applebot-Extended Disallow: / User-agent: CCBot Disallow: / User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: Perplexity-User Allow: / User-agent: Claude-User Allow: / User-agent: * Allow: / Sitemap: https://example.com/sitemap.xml
Google-Extended styr bara användningen för Googles AI-produkter – inte den vanliga sökindexeringen. Den som av misstag spärrar Googlebot försvinner ur sökningen. De två namnen är olika saker och förväxlas regelbundet.
Vad robots.txt inte klarar
Tre begränsningar man bör känna till innan man förlitar sig på filen:
- Den är en begäran. Seriösa leverantörer håller sig till den, andra inte. Den som vill genomdriva tekniskt behöver en spärr på server- eller brandväggsnivå utifrån beteckningen.
- Den verkar inte bakåt. Det som redan har samlats in försvinner inte av det.
- Den skyddar inte mot återgivning ur andra källor. Om ert innehåll citeras någon annanstans hjälper er egen fil inte.
Innan man fattar beslutet lönar sig en blick i serverloggen: vilka av dessa beteckningar dyker över huvud taget upp, hur ofta, och vilka sidor hämtar de?
Vid små webbplatser är resultatet ofta nyktert – få åtkomster, få sidor. Då är frågan praktiskt taget efterställd, och den egentliga uppgiften är en annan: att alls bli hittad. En spärr för crawlers som inte ens kommer löser inget problem och förhindrar bara att det senare blir annorlunda.
Den rättsliga ramen
I EU finns ett förbehåll för text- och datautvinning: rättighetshavare kan uttryckligen förbjuda att deras innehåll används för automatiserad bearbetning, och det förbehållet måste förklaras maskinläsbart. Filen robots.txt är den gängse formen för det, delvis kompletterad med en upplysning i användarvillkoren.
För Schweiz gäller det inte omedelbart; den som riktar innehåll även till EU-användare bör ändå förklara förbehållet om hen önskar det. Det är en punkt som en sakkunnig bör bedöma – det här inlägget ersätter ingen juridisk rådgivning.
Slutsats
Frågan är ingen principiell, utan hänger på affärsmodellen. Den som säljer innehåll spärrar insamlarna. Den som säljer uppdrag tillåter båda – och vinner därigenom omnämnanden hos människor som just söker en lösning.
I vilket fall gäller: betrakta hämtningarna i stunden för sig. Att schablonmässigt spärra dem också är det vanligaste och dyraste felet i detta beslut.
Vanliga frågor
Bör man blockera AI-crawlers?
Det hänger på affärsmodellen. Den som tjänar pengar på innehållet självt – förlag, kursleverantörer, fackmedier – har goda skäl att spärra de förutseende insamlarna. Den som säljer uppdrag eller tjänster förlorar mer på att blockera än hen vinner.
Vad är skillnaden mellan insamlare och hämtningar i stunden?
Insamlare som GPTBot, ClaudeBot eller PerplexityBot hämtar innehåll oberoende av en konkret fråga, för träning eller ett eget index. Hämtningar i stunden som ChatGPT-User, Perplexity-User eller OAI-SearchBot hämtar en sida just när någon har ställt en passande fråga – därur uppstår omnämnanden och länkar.
Vad är Google-Extended?
En beteckning som gör det möjligt att styra användningen av innehåll för Googles AI-produkter – inte den vanliga sökindexeringen. Den är något annat än Googlebot; den som av misstag spärrar denne försvinner ur sökningen.
Håller sig varje crawler till robots.txt?
Nej. Den är en begäran, ingen teknisk spärr. Seriösa leverantörer håller sig till den, andra inte. Den som vill genomdriva en spärr behöver en regel på server- eller brandväggsnivå utifrån beteckningen – och även då verkar den inte bakåt på redan insamlat innehåll.
Hur prövar man vilka crawlers som alls kommer?
Via serverloggen, filtrerad efter de kända beteckningarna. Det visar vilka crawlers som hur ofta hämtar vilka sidor. Vid små webbplatser är resultatet ofta överskådligt – då är spärrfrågan efterställd uppgiften att alls bli hittad.
Marknadsföring som sätter upp sig själv
Betan för Studio Engine är öppen. Säkra din plats och var med och forma den från början.
Delta i betan →