A Stanford és a Washingtoni Egyetem kutatói mindössze 50 dollárnyi felhőalapú számítási kapacitás felhasználásával hoztak létre egy nyílt forráskódú MI „érvelési”-modellt, amely a csúcskategóriás modellekkel, például az OpenAI o1 és a DeepSeek R1 modelljeivel hasonló teljesítményt nyújt matematikai és programozási feladatokban.
Az „s1” névre keresztelt modell és annak teljes tanítási adathalmaza elérhető a GitHubon. A kutatók egy előre elkészített alapmodellt vettek alapul, majd finomhangolás útján továbbfejlesztették, egy olyan eljárással, amelyet „desztillációnak” neveznek. Ez a technika lehetővé teszi, hogy egy meglévő MI-modell válaszait felhasználva kivonják és átvigyék az érvelési képességeket egy másik modellbe.
A kutatók elmondása szerint az s1 modellt a Google Gemini 2.0 Flash Thinking Experimental nevű MI-modelljéből desztillálták. Ez ugyanaz a módszer, amelyet korábban a Berkeley Egyetem kutatói is alkalmaztak, bár ők akkor 450 dollárnyi számítási kapacitást használtak fel saját MI-modelljük létrehozásához.
Játék a macska bajszával?
A s1 megjelenése komoly kérdéseket vet fel az MI-modellek kereskedelmi értékével kapcsolatban. Ha egy többmillió dollárból kifejlesztett modell képességei mindössze néhány kutató és minimális anyagi ráfordítás segítségével lemásolhatók, akkor mi biztosíthatja a nagy MI-laborok piaci előnyét?
Nem meglepő módon a nagy MI-fejlesztők nem nézik jó szemmel ezt a tendenciát. Az OpenAI például azzal vádolta meg a DeepSeeket, hogy jogosulatlanul használta az API-ját a modelljeik desztillációjához.
A s1 kutatói arra törekedtek, hogy a lehető legegyszerűbb módszert találják meg egy erős érvelési teljesítményt nyújtó modell létrehozására. Emellett azt is vizsgálták, hogy egy MI-modell hogyan tudja hosszabb ideig „gondolkodni” egy kérdés megválaszolása előtt, vagyis hogyan lehet a válaszadási folyamatot tudatosan lassítani a jobb eredmény érdekében.
A kutatás szerint az MI-modellek érvelési képességei viszonylag kis adathalmazon is hatékonyan desztillálhatók, ha a megfelelő szupervizionált finomhangolási (SFT) technikát alkalmazzák. Ez a módszer lényegesen olcsóbb, mint a nagy MI-laborok által használt, nagyszabású megerősítéses tanulás.
Bár a Google ingyenes hozzáférést biztosít a Gemini 2.0 Flash Thinking Experimental modellhez a Google AI Studio platformján keresztül, használati feltételei egyértelműen tiltják a visszafejtést és a versenyképes szolgáltatások fejlesztését a modelljeik alapján. A Google egyelőre nem kommentálta az s1 kutatásának eredményeit.
Fél óra alatt
Az s1 egy nyílt forráskódú, Alibaba tulajdonában lévő kínai MI-labor, a Qwen egyik modelljén alapul, amely bárki számára ingyenesen letölthető. A kutatók 1000 gondosan kiválasztott kérdés és válaszok segítségével tanították be az MI-modellt, beleértve a Gemini 2.0 Flash Thinking Experimental gondolkodási folyamatainak másolását is. Az s1 betanítása kevesebb mint 30 percet vett igénybe, és 16 darab Nvidia H100-as GPU használatával történt. A Stanford egyik kutatója, Niklas Muennighoff szerint a szükséges számítási kapacitás bérlése ma már körülbelül 20 dollárból is megoldható.
Egy érdekes trükköt is bevetettek az s1 pontosabb válaszadásának érdekében: az MI-modellt arra utasították, hogy „várjon” a válaszadás előtt, így növelve a gondolkodási időt és ezzel együtt az eredményességet.
2025-ben a Meta, a Google és a Microsoft több száz milliárd dollárt tervez befektetni az MI-infrastruktúra fejlesztésébe és új generációs MI-modellek kiképzésébe. Bár az ilyen szintű beruházások továbbra is kulcsfontosságúak az MI innováció előmozdításában, a desztilláció bizonyította, hogy a meglévő modellek képességei viszonylag alacsony költséggel is reprodukálhatók. Az azonban továbbra is kérdéses, hogy ez a módszer hosszú távon milyen hatással lesz az MI-piacra és az iparág jövőjére.







