Miért lassú a net?

A neten legelnek a botok
[Forrás: huntflyingw.com ]
Automatizálásra van szükség a weben „legelő” MI-tartalomgyűjtők serege ellen. Egy példa: az Anthropic ClaudeBotja 24 óra alatt körülbelül egymilliószor látogatta meg az iFixit.com műszaki tanácsadó oldalt.

 

Az iFixit főnöke, Kyle Wiens a közösségi médiában panaszkodott a hívatlan botlátogatások miatt. „Értem, hogy éhesek az adatokra, de nemcsak a tartalmunkat veszik el fizetés nélkül, hanem a devops-erőforrásainkat is lekötik”. A kiadó az Anthropic botjai által létrehozott forgalom egy részét úgy hárította el, hogy a weboldal robots.txt fájljához, a szabványos bot-elhárító eszközhöz, hozzáadott egy disallow utasítást. Szerencsére ez a bot rendesen viselkedett.

Hab, vagy inkább légy a tortán, hogy az Anthropic Claude MI-asszisztense rossz javítási instrukciókat hallucinált: olyan műveletsort javasolt egy okostelefon javításához, amely tönkreteszi a készüléket. Az iFixit legmagasabb szintű reklamációjára az OpenAI-alapú szolgáltatást nyújtó cég az egyik GYIK-et idézte: „Az Anthropic az adatokat a webről gyűjti össze, amit a webhelytulajdonosok blokkolhatnak. Az iparági szabványnak megfelelően az Anthropic különböző adatforrásokat használ a modellfejlesztéshez, például nyilvánosan elérhető adatokat az internetről, amelyeket egy webjáró bot segítségével gyűjtenek össze. Az Anthropic igyekszik átláthatóvá és nem tolakodóvá tenni a webjáróalapú keresést, és tiszteletben tartja mind a robots.txt-ben foglaltakat, mind az olyan kijátszás elleni mechanizmusokat, mint a CAPTCHA-kihívások.

Nem ez az első eset, hogy egy nagy technológiai vállalat túlzott mennyiségű hálózati forgalmat küld egy másiknak. Alapvetően a Google indexelő botjai folyamatosan figyelik a webet a keresés támogatása céljából. Vannak más keresők is, amelyek saját bothálózatukat használják. Számtalan egyéb célú szoftverautomata használja a webet számtalan értelmes és értelmetlen célra. Egy értelmes cél a különféle webhasználati statisztikák naprakészen tartása.

Népszerű adat, hogy a web forgalmának hány százaléka „hasznos”, és mennyi az ilyen webjárók által okozott terhelés aránya: manapság 10 százalék alatt van a „hasznos”.

A robots.txt 1994-ben született, és egykor nagyrészt egy „állítsd be és felejtsd el” technológia volt. A webjáró robotoknak szóló utasításokat tartalmazza: mit indexelhetnek és mit nem, és melyek azok, amelyeket szívesen látnak, és melyek azok, amelyeket nem – abban a reményben, hogy a botok üzemeltetői tiszteletben tartják a webhelytulajdonosok kívánságait.

„Technikailag nincsenek beépítve magába a protokollba az irányelvek, de a gyakorlatban sokáig működtek a dolgok”, mondta Gavin King, a Dark Visitors alapítója, egy olyan vállalkozásé, amely tartalomvédelmi szolgáltatásokat kínál, beleértve az automatikus robots.txt frissítéseket és a fájlt figyelmen kívül hagyó botok automatikus blokkolását. „Régebben csak néhány bot volt, amellyel az emberek törődtek, és a szabályok legtöbbször inkább arról szóltak, hogy optimistán segítsék őket, például távol tartották a Googlebotot az olyan tartalmaktól, amelyeknek nem volt értelme felbukkanni a keresési eredményekben, vagy általános dolgokat tettek, például sebességkorlátokat állítottak be minden bot számára.”

A mesterséges intelligencia kora azonban drámaian megváltoztatta a helyzetet. Az MI-vel foglalkozó cégek elszaporodtak, és sokan „legelnek” a weboldalakon, hogy adatokat gyűjtsenek. Egy szervezet, cég több botot is üzemeltethet. Amikor a tartalomszolgáltató azt hiszi, hogy megállította az egyik webjárót, máris felbukkan egy másik ugyanattól a cégtől. „Populációrobbanásnak vagyunk tanúi az interneten kúszó mesterséges ágensek ökoszisztémájában”, jelentette ki King. „Az OpenAI például épp a múlt héten indított egy újat OAI-SearchBot néven, a Meta az előző héten Meta-ExternalAgent néven, az Apple pedig a múlt hónapban Applebot-Extended néven.”

A webjáró botok növekvő száma azt jelenti, hogy a webhelytulajdonosoknak nehéz naprakészen tartaniuk a robots.txt fájljaikat, hogy kontrollálni tudják ezeket az új ügynököket. Megjegyezzük, hogy az OpenAI és a Google tavaly útmutatót tett közzé arról, hogyan lehet blokkolni a saját robotjaikat.

Lassan egy új szolgáltatási terület alakul ki: hogyan lehet automatizálni a robots.txt folyamatos naprakészen tartását, és hogyan lehet távoltartani a robots.txt-t figyelmen kívül hagyó ágenseket. A Cloudflare nemrég jelentette be saját bot-blokkoló szolgáltatásának továbbfejlesztését, hogy több MI-alapú webjárót utasítson el. Régóta ismert, hogy egyes webjárók figyelmen kívül hagyják a robots.txt beállításait, de King szerint a legtöbb vállalat tiszteletben tartja a szabályokat. „A legtöbbjük megfelelő user agent stringgel azonosítja magát, és 24 órán belül, ésszerű cache-késleltetés után elkezdi követni a szabályokat. Alapvetően az összes nagy cég ezt teszi. De mindig lehetséges, hogy normális forgalomnak álcázott ‘adatlegelés.’ zajlik.”

(Forrás

További tartalmak

Legolvasottabb tartalmak

Strategy

Valós idejű adózás

Human

Az egészség hálózatai

Technology

Egy év, amely átírta az emberiség és a mesterséges intelligencia viszonyát

Strategy

Exportcikk lehet a DÁP-ból

ITBUSINESS heti hírlevél feliratkozás

.
Scroll to Top