Automatizálásra van szükség a weben „legelő” MI-tartalomgyűjtők serege ellen. Egy példa: az Anthropic ClaudeBotja 24 óra alatt körülbelül egymilliószor látogatta meg az iFixit.com műszaki tanácsadó oldalt.
Az iFixit főnöke, Kyle Wiens a közösségi médiában panaszkodott a hívatlan botlátogatások miatt. „Értem, hogy éhesek az adatokra, de nemcsak a tartalmunkat veszik el fizetés nélkül, hanem a devops-erőforrásainkat is lekötik”. A kiadó az Anthropic botjai által létrehozott forgalom egy részét úgy hárította el, hogy a weboldal robots.txt fájljához, a szabványos bot-elhárító eszközhöz, hozzáadott egy disallow utasítást. Szerencsére ez a bot rendesen viselkedett.
Hab, vagy inkább légy a tortán, hogy az Anthropic Claude MI-asszisztense rossz javítási instrukciókat hallucinált: olyan műveletsort javasolt egy okostelefon javításához, amely tönkreteszi a készüléket. Az iFixit legmagasabb szintű reklamációjára az OpenAI-alapú szolgáltatást nyújtó cég az egyik GYIK-et idézte: „Az Anthropic az adatokat a webről gyűjti össze, amit a webhelytulajdonosok blokkolhatnak. Az iparági szabványnak megfelelően az Anthropic különböző adatforrásokat használ a modellfejlesztéshez, például nyilvánosan elérhető adatokat az internetről, amelyeket egy webjáró bot segítségével gyűjtenek össze. Az Anthropic igyekszik átláthatóvá és nem tolakodóvá tenni a webjáróalapú keresést, és tiszteletben tartja mind a robots.txt-ben foglaltakat, mind az olyan kijátszás elleni mechanizmusokat, mint a CAPTCHA-kihívások.
Nem ez az első eset, hogy egy nagy technológiai vállalat túlzott mennyiségű hálózati forgalmat küld egy másiknak. Alapvetően a Google indexelő botjai folyamatosan figyelik a webet a keresés támogatása céljából. Vannak más keresők is, amelyek saját bothálózatukat használják. Számtalan egyéb célú szoftverautomata használja a webet számtalan értelmes és értelmetlen célra. Egy értelmes cél a különféle webhasználati statisztikák naprakészen tartása.
Népszerű adat, hogy a web forgalmának hány százaléka „hasznos”, és mennyi az ilyen webjárók által okozott terhelés aránya: manapság 10 százalék alatt van a „hasznos”.
| A robots.txt 1994-ben született, és egykor nagyrészt egy „állítsd be és felejtsd el” technológia volt. A webjáró robotoknak szóló utasításokat tartalmazza: mit indexelhetnek és mit nem, és melyek azok, amelyeket szívesen látnak, és melyek azok, amelyeket nem – abban a reményben, hogy a botok üzemeltetői tiszteletben tartják a webhelytulajdonosok kívánságait. |
„Technikailag nincsenek beépítve magába a protokollba az irányelvek, de a gyakorlatban sokáig működtek a dolgok”, mondta Gavin King, a Dark Visitors alapítója, egy olyan vállalkozásé, amely tartalomvédelmi szolgáltatásokat kínál, beleértve az automatikus robots.txt frissítéseket és a fájlt figyelmen kívül hagyó botok automatikus blokkolását. „Régebben csak néhány bot volt, amellyel az emberek törődtek, és a szabályok legtöbbször inkább arról szóltak, hogy optimistán segítsék őket, például távol tartották a Googlebotot az olyan tartalmaktól, amelyeknek nem volt értelme felbukkanni a keresési eredményekben, vagy általános dolgokat tettek, például sebességkorlátokat állítottak be minden bot számára.”
A mesterséges intelligencia kora azonban drámaian megváltoztatta a helyzetet. Az MI-vel foglalkozó cégek elszaporodtak, és sokan „legelnek” a weboldalakon, hogy adatokat gyűjtsenek. Egy szervezet, cég több botot is üzemeltethet. Amikor a tartalomszolgáltató azt hiszi, hogy megállította az egyik webjárót, máris felbukkan egy másik ugyanattól a cégtől. „Populációrobbanásnak vagyunk tanúi az interneten kúszó mesterséges ágensek ökoszisztémájában”, jelentette ki King. „Az OpenAI például épp a múlt héten indított egy újat OAI-SearchBot néven, a Meta az előző héten Meta-ExternalAgent néven, az Apple pedig a múlt hónapban Applebot-Extended néven.”
A webjáró botok növekvő száma azt jelenti, hogy a webhelytulajdonosoknak nehéz naprakészen tartaniuk a robots.txt fájljaikat, hogy kontrollálni tudják ezeket az új ügynököket. Megjegyezzük, hogy az OpenAI és a Google tavaly útmutatót tett közzé arról, hogyan lehet blokkolni a saját robotjaikat.
Lassan egy új szolgáltatási terület alakul ki: hogyan lehet automatizálni a robots.txt folyamatos naprakészen tartását, és hogyan lehet távoltartani a robots.txt-t figyelmen kívül hagyó ágenseket. A Cloudflare nemrég jelentette be saját bot-blokkoló szolgáltatásának továbbfejlesztését, hogy több MI-alapú webjárót utasítson el. Régóta ismert, hogy egyes webjárók figyelmen kívül hagyják a robots.txt beállításait, de King szerint a legtöbb vállalat tiszteletben tartja a szabályokat. „A legtöbbjük megfelelő user agent stringgel azonosítja magát, és 24 órán belül, ésszerű cache-késleltetés után elkezdi követni a szabályokat. Alapvetően az összes nagy cég ezt teszi. De mindig lehetséges, hogy normális forgalomnak álcázott ‘adatlegelés.’ zajlik.”
(Forrás)







