Az Anthropic új MI-modellje addig „gondolkodik”, ameddig csak szeretnénk

Anthropic Claude
Az Anthropic egy újgenerációs MI-modellt dob piacra Claude 3.7 Sonnet névvel. A vállalat szerint ez az első „hibrid MI-érvelési modell”, amely képes azonnali válaszokat adni, de akár hosszabb időt is eltölthet a kérdések alaposabb átgondolásával. A felhasználók dönthetnek arról, hogy a modell „gondolkodási” képességét aktiválják-e, ezáltal rövidebb vagy hosszabb válaszadási folyamatot választva.

 

A fejlesztés az Anthropic azon törekvésének része, hogy leegyszerűsítse az MI-eszközök használatát. Sok MI-chatbot jelenleg különböző modellek közül engedi kiválasztani a felhasználónak a megfelelő változatot, ami költségben és teljesítményben is eltéréseket okoz. Az Anthropic ezzel szemben azt szeretné, ha egyetlen modell elég lenne minden feladathoz.

A Claude 3.7 Sonnet „gondolkodási” módjai csak az Anthropic prémium előfizetői számára lesznek hozzáférhetők, míg az ingyenes verziót használók a hagyományos módon működő Claude 3.7 Sonnet változatot kapják. Az új modell állítólag felülmúlja az elődjét, a Claude 3.5 Sonnet-et.

Claude extended
[Forrás: Anthropic]
Az árazás tekintetében a Claude 3.7 Sonnet 3 dollárba kerül millió bevitt tokenenként, és 15 dollárba millió kimeneti tokenenként. Ez magasabb ár, mint például az OpenAI o3-mini modelljének (1,10 dollár / millió bevitt token, 4,40 dollár / millió kimeneti token) vagy a DeepSeek R1-ének (55 cent / millió bevitt token, 2,19 dollár / millió kimeneti token). Azonban fontos megjegyezni, hogy ezek kizárólag érvelési modellek, míg a Claude 3.7 Sonnet egy hibrid megoldás.

A Claude új „gondolkodási” módjai

A Claude 3.7 Sonnet az első olyan Anthropic-modell, amely kifejezetten az érvelési képességekre épít. Az MI-fejlesztésben egyre inkább elterjedő technika lényege, hogy a modellek több időt és számítási kapacitást használnak egy kérdés megválaszolására, így javítva a pontosságot. Hasonló érvelési modellek közé tartozik például az OpenAI o3-mini, a DeepSeek R1, a Google Gemini 2.0 Flash Thinking és az xAI Grok 3 (Think). Ezek a modellek a problémákat kisebb lépésekre bontják, ami segít pontosabb válaszokat adni – bár nem úgy gondolkodnak, mint egy ember, folyamatuk a deduktív érvelésen alapul.

Az Anthropic hosszú távú tervei szerint a Claude-modelleknek maguktól kellene eldönteniük, hogy egy adott kérdés mennyi „gondolkodási” időt igényel, anélkül, hogy a felhasználónak be kellene állítania ezt. Dianne Penn, az Anthropic termék- és kutatásfejlesztési vezetője szerint a cél az, hogy az MI-modellek ugyanúgy működjenek, mint az emberi gondolkodás, ahol nincs szükség két külön agyra a gyors és az alapos válaszokhoz.

Az új modell átláthatóbb működést is ígér: a Claude 3.7 Sonnet „látható jegyzettömböt” (visible scratch pad) használ, amely bemutatja a belső gondolkodási folyamatát. A felhasználók számára ez lehetőséget ad arra, hogy nyomon kövessék, hogyan jutott az MI egy adott válaszhoz. Bizonyos részek azonban biztonsági okokból el lesznek rejtve.

Kódolási feladatok és intelligensebb válaszok

Az Anthropic szerint a Claude 3.7 Sonnet valódi feladatokra optimalizált gondolkodási módokat kínál, például összetett kódolási problémák vagy ügynöki (agentic) feladatok megoldásához. A fejlesztők az MI API-n keresztül szabályozhatják a „gondolkodásra szánt költségvetést”, vagyis egyensúlyozhatnak a sebesség, a költség és a válasz minősége között.

A modell teljesítményét teszteken is összehasonlították más MI-kkel. A Claude 3.7 Sonnet a SWE-Bench teszten (amely valódi kódolási feladatokat mér) 62,3%-os pontosságot ért el, míg az OpenAI o3-mini modellje csak 49,3%-ot. Egy másik, MI-ügynökök viselkedését szimuláló teszten (TAU-Bench) a Claude 3.7 Sonnet 81,2%-ot ért el, míg az OpenAI o1 modellje 73,5%-ot.

Ezenkívül az Anthropic azt állítja, hogy a modell kevésbé fog visszautasítani bizonyos kérdéseket, mint elődei. Az MI pontosabb megkülönböztetéseket tud tenni a káros és ártalmatlan kérdések között, és 45%-kal kevesebb felesleges elutasítást ad, mint a Claude 3.5 Sonnet.

Claude 37 teszt
[Forrás: Anthropic]
Claude Code: egy új ügynöki kódolási eszköz

A Claude 3.7 Sonnet mellett az Anthropic egy új kódolási eszközt is bevezet, a Claude Code-ot. A kutatási fázisban lévő fejlesztés lehetővé teszi, hogy a Claude modellel közvetlenül a terminálon keresztül dolgozzanak. Az Anthropic demója során bemutatta, hogy a Claude Code hogyan képes elemezni egy kódprojektet egy egyszerű utasítással, például: „Magyarázd el ennek a projektnek a szerkezetét.” A fejlesztők egyszerű angol nyelvű parancsokkal módosíthatják a kódbázist, a Claude Code pedig részletes leírást ad a változtatásokról, ellenőrzi a hibákat, és akár egy GitHub-repozitóriumba is feltölti a módosításokat.

A Claude Code kezdetben csak korlátozott számú felhasználó számára lesz elérhető, az Anthropic pedig érkezési sorrendben engedélyezi a hozzáférést.

Verseny az MI-piacon

A Claude 3.7 Sonnet egy olyan időszakban érkezik, amikor az MI-laborok soha nem látott tempóban dobják piacra új generációs modelleiket. Az Anthropic eddig óvatosabb, biztonságközpontú megközelítést alkalmazott, de most arra törekszik, hogy vezető szerepet töltsön be a piacon. A nagy kérdés azonban az, hogy meddig tart ez az előny. Az OpenAI már jelezte, hogy hamarosan saját hibrid MI-modellt mutat be – Sam Altman vezérigazgató szerint erre néhány hónapon belül sor kerülhet.

További tartalmak

Legolvasottabb tartalmak

Strategy

Valós idejű adózás

Human

Az egészség hálózatai

Technology

Egy év, amely átírta az emberiség és a mesterséges intelligencia viszonyát

Strategy

Exportcikk lehet a DÁP-ból

ITBUSINESS heti hírlevél feliratkozás

.
Scroll to Top