QwQ-32B-Preview: az Alibaba új kihívója a ChatGPT o1-gyel szemben

Egy új, „érvelési” mesterségesintelligencia-modell, a QwQ-32B-Preview érkezett a színtérre. Ez az egyik első olyan modell, amely képes felvenni a versenyt az OpenAI o1-es modelljével, ráadásul engedélyező licenc alatt letölthető.

 

Az Alibaba Qwen csapata által fejlesztett QwQ-32B-Preview 32,5 milliárd paramétert tartalmaz, és akár 32 ezer szavas feladatokat is képes kezelni. Bizonyos tesztekben jobb teljesítményt nyújt, mint az OpenAI által eddig kiadott két érvelési modell, az o1-preview és az o1-mini (a paraméterek száma nagyjából egy modell problémamegoldó képességeivel arányos, és minél több paraméterrel rendelkezik egy modell, általában annál jobb teljesítményt nyújt. Az OpenAI nem közli modelljeinek paraméterszámát).

Az engedélyező licencek olyan nyílt forráskódú licencek, amelyek lehetővé teszik, hogy bárki korlátozás vagy kötelezettség nélkül használhassa, módosíthassa és terjeszthesse a szoftvert. Ez azt jelenti, hogy a szoftver és származékai beépíthetők védett vagy zárt forráskódú termékekbe anélkül, hogy a forráskódot nyilvánosságra kellene hozni vagy a módosításokat meg kellene osztani.

Az Alibaba tesztjei alapján a QwQ-32B-Preview az AIME és MATH teszteken jobb eredményeket ért el, mint az OpenAI o1 modelljei. Az AIME más mesterségesintelligencia-modellek segítségével értékeli a teljesítményt, míg a MATH szöveges matematikai problémák gyűjteménye.

Az érvelési képességeinek köszönhetően a QwQ-32B-Preview logikai rejtvényeket old meg és viszonylag összetett matematikai kérdésekre ad választ. Azonban nem hibátlan: az Alibaba egy blogposztjában megjegyezte, hogy a modell néha váratlanul nyelvet vált, ismétlődő ciklusokba ragadhat, és gyengébben teljesít az olyan feladatokban, amelyek „köznyelvi érvelést” igényelnek.

Önellenőrzés és tervezett érvelés

A legtöbb MI-modelltől eltérően a QwQ-32B-Preview és más érvelési modellek képesek saját magukat hatékonyan ellenőrizni. Ez segít elkerülni azokat a buktatókat, amelyek más modelleket gyakran félrevezetnek, bár ennek ára a hosszabb feldolgozási idő. Az o1-hez hasonlóan a QwQ-32B-Preview is logikus lépések sorozatán keresztül tervezi meg a feladatait, hogy pontosabb válaszokat találjon.

A modell letölthető és futtatható a Hugging Face fejlesztői platformon, és hasonló a nemrég kiadott DeepSeek érvelési modellhez abban, hogy óvatosan kezeli a politikailag érzékeny témákat. Az Alibaba és a DeepSeek, mint kínai cégek, megfelelnek a kínai internetes szabályozó hatóság előírásainak, amelyek megkövetelik, hogy válaszaik „megtestesítsék az alapvető szocialista értékeket.” Emiatt sok kínai MI-rendszer elutasítja azokat a témákat, amelyek a hatóságok ellenszenvét kiválthatnák, például a Hszi Csin-ping rendszerével kapcsolatos találgatásokat.

Amikor például azt kérdezték tőle, hogy „Tajvan Kína része-e?”, a QwQ-32B-Preview azt válaszolta, hogy igen, és „elidegeníthetetlenül” is, ami eltér a világ nagy részének álláspontjától, de összhangban van Kína hivatalos politikájával. A Tienanmen térrel kapcsolatos kérdésekre pedig nem adott választ.

Az érvelési modellek jövője

Az érvelési modellekre fordított figyelem nőtt, mivel a „skálázási törvények” életképessége – azaz az az elképzelés, hogy több adat és számítási kapacitás folyamatosan növeli a modellek képességeit – megkérdőjeleződött. Egyre több sajtójelentés szerint az olyan nagy MI-laborok, mint az OpenAI, a Google és az Anthropic modelljei nem fejlődnek olyan drámai ütemben, mint korábban. Ez új megközelítések, architektúrák és fejlesztési technikák kereséséhez vezetett, amelyek egyike a „tesztidőszaki számítás” (test-time compute). Ez a megközelítés lényegében extra feldolgozási időt biztosít a modelleknek a feladatok elvégzéséhez, és az o1-hez hasonlóan az QwQ-32B-Preview is ezen az alapelven működik.

Az OpenAI mellett más nagy laborok és kínai cégek is arra fogadnak, hogy a tesztidőszaki számítás az AI fejlődésének kulcsa. Egy friss jelentés szerint például a Google mintegy 200 főre bővítette belső érvelési modellekkel foglalkozó csapatát, és jelentős számítási kapacitást irányított erre a területre.

További tartalmak

Legolvasottabb tartalmak

Strategy

Valós idejű adózás

Human

Az egészség hálózatai

Technology

Egy év, amely átírta az emberiség és a mesterséges intelligencia viszonyát

Strategy

Exportcikk lehet a DÁP-ból

ITBUSINESS heti hírlevél feliratkozás

.
Scroll to Top