4 min read

AI-roomaja logide lugemine: mida GPTBot tegelikult pärib

AI-roomajad jätavad sinu serverilogidesse väga loetavaid mustreid. Kuidas botte segmenteerida, mida igaühe päringumuster tähendab ja kaks küsimust, millele tasub vastata enne, kui puutud kokku GEO-tööriistaga.

GEOAI CrawlersTechnical SEOLogs
AI-roomaja logide lugemine: mida GPTBot tegelikult pärib

Enamik GEO-nõuandeid algab sisust. Meie arvates peaks see algama logidest, sest sinu server hoiab juba kõige odavamat andmestikku AI nähtavuse kohta: ajatempliga kirjet sellest, millised assistendibotid milliseid lehti tõmbasid, kui tihti ja mis järjekorras. Selle lugemine vastab kahele küsimusele, millele ükski armatuurlaud ei vasta — kas keegi AI-d tegelikult loeb meid, ja mida nad peavad tõmbamist väärt olevaks.

See on praktiline jätk meie AI-roomajate juhendile. Samad tegelased; seekord vaatame, mida nad teevad pärast käepigistust.

Esiteks: segmenteeri botid, muidu on andmed müra

Levinud viga on käsitleda "AI-liiklust" ühe ämbrina. Botid ei käitu üldse sarnaselt ja nende segamine annab keskmisi, mis ei tähenda midagi.

  • Treeningroomajad — GPTBot, ClaudeBot, anthropic-ai, Google-Extended, CCBot — roomavad ühtlaselt ja laialdaselt. Nende tõmbed toidavad tulevasi mudelikaale, mitte tänaseid vastuseid.
  • Otsinguroomajad — OAI-SearchBot, PerplexityBot — ehitavad indeksit, millest otsingupõhised vastused tsiteerivad. Need on need, kelle tähelepanu sa tahad uutel lehtedel sel nädalal.
  • Kasutaja käivitatud tõmbajad — ChatGPT-User, Claude-User, Perplexity-User — tõmbavad lehe ainult siis, kui konkreetse kasutaja vestlus seda vajab. Iga tabamus siin on kviitung: päris inimene küsis sinu kohta praegu.

Käsud

Igal juurdepääsulogil (nginx/Caddy formaat sobib) esimene läbimine:

# All AI crawler hits in the current log, newest last
grep -E "GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|anthropic-ai|PerplexityBot|Perplexity-User|Google-Extended" access.log \
  | awk '{print $NF}' | sort | uniq -c | sort -rn

See annab sulle toore mahu edetabeli. Huvitav lõige on bot × tee:

# Which pages each bot fetches
grep "GPTBot" access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head -20

Kaks mustrit, mida otsida. Treeningroomaja, kes tõmbab /robots.txt ja seejärel laia, ühtlast lehtede valikut, indekseerib. Otsinguroomaja, kes tõmbab /, sinu saidikaardi, seejärel kitsa hulga konkreetseid lehti, järgib asjakohasust — ja lehed, mida ta eirab, on need, mida ta ei pea tsiteeritavaks.

Kolm mustrit, mida tasub diagnoosida

1. Otsingubot ei ilmu kunagi. Kui OAI-SearchBot või PerplexityBot on kuu jooksul null tabamust, on tavalised põhjused vanast mallist kopeeritud robots.txt lubatud loend (see keelab üldise mustri, mille alla nad kuuluvad), või sait, mis muutub harva — otsinguindeksid jätavad staatilised saidid vahele. Lahendus on robots.txt ja llms.txt töö, pluss nähtav uuendamise rütm.

2. Kasutaja käivitatud tabamused tõusevad päevadel, mil sa ei teinud midagi. ChatGPT-User ja Perplexity-User tõmbavad ainult siis, kui reaalajas kasutaja vestlus vajab seda lehte. Puhang ilma sinupoolse avaldamiseta tähendab tavaliselt, et keegi jagas või arutas sinu toodet — kogukonnaliiklus, mida analüütikaarmatuurlaud sellisena ei märgista. Tasub samal päeval oma viitajad üle grep'ida.

3. Treeningroomaja tõmbab sinu privaatseid lehti. Kui GPTBot tabab /dashboard või /settings, siis sinu robots.txt ei ütle seda, mida sa arvad — valesti kirjutatud User-agent rida lülitab vaikselt välja terve grupi. Meie robots.txt mall hoiab privaatsed teed blokeerituna, jättes tsiteerimisega seotud lehed avatuks.

Kaks ausat hoiatust

User-agent stringid on väited, mitte identiteedid. Igaüks võib curl'ida User-agent: GPTBot-iga. Loendamise eesmärgil on see korras; paranoia puhul stiilis "kas konkurent kraapis mu tervet saiti", kontrolli omandiõigust nii, nagu suuremad pakkujad dokumenteerivad (pöörd-DNS nende puhul, kes seda toetavad), enne järelduste tegemist.

Maht ei ole KPI. Treeningroomaja, kes tõmbab 4000 lehte, ütleb sulle, et sa oled tulevase mudeli dieedis. Number, mis üüri maksab, on kasutaja käivitatud ja otsingu tõmbete arv lehtedel, mis konverteerivad — see on torujuhtme osa, kus tänane tõmme võib saada homseks külastajaks.

Kaks küsimust

Käivita segmenteerimine üks kord, vasta nendele ja sa tead rohkem kui enamik saite, kes on ostnud GEO-tellimuse:

  1. Kas otsingupõhised botid tõmbavad mu uusi lehti päevade jooksul pärast avaldamist? Kui ei, siis indeks, mis toidab tsiteeritavaid vastuseid, ei tea, et sa eksisteerid.
  2. Milliseid lehti otsingubotid kunagi ei tõmba? Need lehed on assistentidele nähtamatud, olenemata sellest, kui hea nende sisu on.

Mõlemad parandused on ilmetud — robots.txt parandused, sisemised lingid, uuendamise rütm —, mis ongi täpselt põhjus, miks logisid tasub lugeda enne kõike muud.

Valmis midagi uut?

Käivita see aat.ee-s ja pane end leitavaks

Püsiv dofollow kirje indekseeritud kataloogis
Mainitud ja tsiteeritud AI-abivahendite poolt
Esita oma projekt