Verkkopalveluiden ylläpitäjät ovat viime vuosina joutuneet totuttelemaan uuteen liikenneluokkaan: tekoäly-yhtiöiden crawlereihin, jotka käyvät läpi verkkosivuja hakua, indeksointia ja mallien toimintaa varten. GreyNoisen tuore havainto näyttää, että myös hyökkääjät ovat huomanneet tämän luottamuksen.

GreyNoise kertoo havainneensa automatisoituja skannereita, jotka esiintyivät OpenAI:n, Anthropicin, DeepSeekin sekä useiden muiden tunnettujen yhtiöiden crawler-nimillä. Pelkkä nimi oli kuitenkin kulissi. Liikenne ei käyttäytynyt kuten oikea crawler, vaan etsi tiedostoja ja polkuja, joista voi löytyä salasanoja, API-avaimia, pilvitunnuksia ja muita arkaluonteisia tietoja.

User agent ei ole henkilöllisyystodistus

Jokainen HTTP-pyyntö voi sisältää niin sanotun user agent -merkkijonon, jolla asiakas kertoo olevansa esimerkiksi Chrome, Googlebot tai ClaudeBot. Ongelma on yksinkertainen: merkkijono on asiakkaan itse ilmoittama, eikä se todista mitään lähettäjän todellisesta identiteetistä.

GreyNoisen mukaan hyökkääjien käyttämä ClaudeBot-merkkijono vastasi Anthropicin dokumentoimaa nimeä merkki merkiltä. Jos suojaus tai pääsynhallinta tarkistaa vain nimen, hyökkääjä voi siis näyttää järjestelmän silmissä aidolta crawlerilta ilman mitään muuta temppua.

Tämä ei ole vain teoreettinen ongelma. Monet organisaatiot sallivat tunnetuille hakuroboteille poikkeuksia palomuureissa, botinhallinnassa tai nopeusrajoituksissa. Jos poikkeus perustuu vain user agentiin, hyökkääjä voi yrittää käyttää sitä hyväkseen.

Kuusi crawler-nimeä, 824 IP-osoitetta

GreyNoise tunnisti 28. heinäkuuta ja 23. elokuuta 2026 väliseltä ajalta kuusi AI-crawler-nimeä, jotka esiintyivät samalla HTTP-asiakasfingerprintillä. Nimet kuuluivat Anthropicin, OpenAI:n, Googlen ja Perplexityn crawleri-identiteetteihin. Liikenne tuli 824 eri IP-osoitteesta.

Yksi erityisen paljastava nimi oli Google-Extended. Google itse dokumentoi sen robots.txt-ohjeistukseen tarkoitetuksi tokeniksi, ei varsinaiseksi HTTP user agentiksi. Toisin sanoen yksikään Googlen oikea crawler ei lähetä sitä user agentinaan. GreyNoise havaitsi kuitenkin tällä nimellä yli 263 000 sessiota.

Oikea crawler lukee robots.txt:n – nämä eivät

Normaali hakurobotti tarkistaa tyypillisesti sivuston /robots.txt-tiedoston, josta se lukee sivuston määrittämät indeksointi- ja käyttörajoitukset. GreyNoisen tarkastelemassa väärennetyssä liikenteessä kuusi AI-crawler-nimeä eivät pyytäneet robots.txt-tiedostoa kertaakaan.

Sen sijaan pyynnöt kohdistuivat tiedostoihin ja hakemistoihin, joista hyökkääjä voi saada suoraan käyttökelpoisia salaisuuksia. GreyNoisen havaintojen mukaan kohteina olivat muun muassa:

  • /.env
  • /app/.env
  • /.env.production
  • /.aws/credentials
  • /.git/config
  • yksityiset avaimet ja salasanasäilöt

.env-tiedosto on erityisen kiinnostava kohde, koska siihen tallennetaan usein tietokantatunnuksia, pilvipalveluiden avaimia, API-tokeneita ja muita sovelluksen tarvitsemia salaisuuksia. Jos tällainen tiedosto on vahingossa saavutettavissa web-palvelimen kautta, seuraukset voivat olla huomattavasti vakavampia kuin yhden sivuston kompromettoituminen.

IP-osoitteet paljastivat naamion

OpenAI, Anthropic, Google ja Perplexity julkaisevat IP-osoitealueita, joista niiden oikeiden crawlerien liikenteen pitäisi tulla. GreyNoise vertasi kaikkia 824 havaittua osoitetta näihin julkaistuihin listoihin.

Yksikään osoitteista ei osunut oikeiden crawlerien julkaistuihin verkkoalueisiin.

Samaan aikaan GreyNoise näki oikeaa ClaudeBot-liikennettä Anthropicin julkaisemista osoitteista. Tämä tekee eron olennaiseksi: sama nimi voi esiintyä sekä aidossa että väärennetyssä liikenteessä, joten tunnistus ei voi perustua pelkkään merkkijonoon.

Yksi verkko ei myöskään ratkaise ongelmaa

Hyökkääjien 824 IP-osoitetta olivat hajautuneet 795 eri /24-verkkoon. Tämä tarkoittaa, ettei liikennettä voi yksinkertaisesti pysäyttää estämällä yhden palveluntarjoajan tai yhden pienen verkkoalueen.

GreyNoisen mukaan käytännöllinen puolustus on yhdistää crawler-nimi muuhun todentamiseen. Jos liikenne väittää olevansa tunnettu crawler, sen lähdeosoite pitäisi tarkistaa kyseisen toimijan julkaisemaa IP-listaa vasten. Lisäksi organisaation kannattaa hälyttää pyynnöistä, jotka kohdistuvat tiedostoihin kuten /.env, /.aws/credentials ja /.git/config.

Varsinainen ongelma on luottamus

Tapauksessa ei ole kyse uudenlaisesta teknisestä haavoittuvuudesta. User agentin väärentäminen on ollut mahdollista niin kauan kuin HTTP-pyyntöjä on tehty. Uutta on ympäristö, jossa yhä useampi järjestelmä tunnistaa tekoäly-yhtiöiden crawlereita nimeltä ja saattaa antaa niille poikkeuksia.

Hyökkääjälle tämä tarjoaa valmiin naamion. Tunnettu AI-crawler näyttää ensisilmäyksellä normaalilta taustaliikenteeltä, ja nimi voi jopa vähentää epäilyksiä verrattuna täysin tuntemattomaan bottiin.

GreyNoisen havainto on hyvä muistutus siitä, että itse ilmoitettu tunniste ei ole koskaan todiste identiteetistä. Kun crawler-nimelle annetaan oikeuksia, poikkeuksia tai luottamusta, nimen rinnalle tarvitaan myös todellinen tekninen varmennus.

Lähde: GreyNoise, 28.8.2026.

Kommentoi