Egy új, „érvelési” mesterségesintelligencia-modell, a QwQ-32B-Preview érkezett a színtérre. Ez az egyik első olyan modell, amely képes felvenni a versenyt az OpenAI o1-es modelljével, ráadásul engedélyező licenc alatt letölthető.
Az Alibaba Qwen csapata által fejlesztett QwQ-32B-Preview 32,5 milliárd paramétert tartalmaz, és akár 32 ezer szavas feladatokat is képes kezelni. Bizonyos tesztekben jobb teljesítményt nyújt, mint az OpenAI által eddig kiadott két érvelési modell, az o1-preview és az o1-mini (a paraméterek száma nagyjából egy modell problémamegoldó képességeivel arányos, és minél több paraméterrel rendelkezik egy modell, általában annál jobb teljesítményt nyújt. Az OpenAI nem közli modelljeinek paraméterszámát).
| Az engedélyező licencek olyan nyílt forráskódú licencek, amelyek lehetővé teszik, hogy bárki korlátozás vagy kötelezettség nélkül használhassa, módosíthassa és terjeszthesse a szoftvert. Ez azt jelenti, hogy a szoftver és származékai beépíthetők védett vagy zárt forráskódú termékekbe anélkül, hogy a forráskódot nyilvánosságra kellene hozni vagy a módosításokat meg kellene osztani. |
Az Alibaba tesztjei alapján a QwQ-32B-Preview az AIME és MATH teszteken jobb eredményeket ért el, mint az OpenAI o1 modelljei. Az AIME más mesterségesintelligencia-modellek segítségével értékeli a teljesítményt, míg a MATH szöveges matematikai problémák gyűjteménye.
Az érvelési képességeinek köszönhetően a QwQ-32B-Preview logikai rejtvényeket old meg és viszonylag összetett matematikai kérdésekre ad választ. Azonban nem hibátlan: az Alibaba egy blogposztjában megjegyezte, hogy a modell néha váratlanul nyelvet vált, ismétlődő ciklusokba ragadhat, és gyengébben teljesít az olyan feladatokban, amelyek „köznyelvi érvelést” igényelnek.
Önellenőrzés és tervezett érvelés
A legtöbb MI-modelltől eltérően a QwQ-32B-Preview és más érvelési modellek képesek saját magukat hatékonyan ellenőrizni. Ez segít elkerülni azokat a buktatókat, amelyek más modelleket gyakran félrevezetnek, bár ennek ára a hosszabb feldolgozási idő. Az o1-hez hasonlóan a QwQ-32B-Preview is logikus lépések sorozatán keresztül tervezi meg a feladatait, hogy pontosabb válaszokat találjon.
A modell letölthető és futtatható a Hugging Face fejlesztői platformon, és hasonló a nemrég kiadott DeepSeek érvelési modellhez abban, hogy óvatosan kezeli a politikailag érzékeny témákat. Az Alibaba és a DeepSeek, mint kínai cégek, megfelelnek a kínai internetes szabályozó hatóság előírásainak, amelyek megkövetelik, hogy válaszaik „megtestesítsék az alapvető szocialista értékeket.” Emiatt sok kínai MI-rendszer elutasítja azokat a témákat, amelyek a hatóságok ellenszenvét kiválthatnák, például a Hszi Csin-ping rendszerével kapcsolatos találgatásokat.
Amikor például azt kérdezték tőle, hogy „Tajvan Kína része-e?”, a QwQ-32B-Preview azt válaszolta, hogy igen, és „elidegeníthetetlenül” is, ami eltér a világ nagy részének álláspontjától, de összhangban van Kína hivatalos politikájával. A Tienanmen térrel kapcsolatos kérdésekre pedig nem adott választ.
Az érvelési modellek jövője
Az érvelési modellekre fordított figyelem nőtt, mivel a „skálázási törvények” életképessége – azaz az az elképzelés, hogy több adat és számítási kapacitás folyamatosan növeli a modellek képességeit – megkérdőjeleződött. Egyre több sajtójelentés szerint az olyan nagy MI-laborok, mint az OpenAI, a Google és az Anthropic modelljei nem fejlődnek olyan drámai ütemben, mint korábban. Ez új megközelítések, architektúrák és fejlesztési technikák kereséséhez vezetett, amelyek egyike a „tesztidőszaki számítás” (test-time compute). Ez a megközelítés lényegében extra feldolgozási időt biztosít a modelleknek a feladatok elvégzéséhez, és az o1-hez hasonlóan az QwQ-32B-Preview is ezen az alapelven működik.
Az OpenAI mellett más nagy laborok és kínai cégek is arra fogadnak, hogy a tesztidőszaki számítás az AI fejlődésének kulcsa. Egy friss jelentés szerint például a Google mintegy 200 főre bővítette belső érvelési modellekkel foglalkozó csapatát, és jelentős számítási kapacitást irányított erre a területre.







