Az Apple nyolcféle kis MI-modellt mutat be

A mesterséges intelligencia világában az utóbbi időben egyre népszerűbbek az úgynevezett „kis nyelvi modellek”, mivel ezek egy helyi eszközön futtathatók ahelyett, hogy adatközponti szintű számítógépeket igényelnének a felhőben. Az Apple bemutatta az „OpenELM” nevű, apró forrásból elérhető MI-nyelvi modelleket, amelyek elég kicsik ahhoz, hogy közvetlenül egy okostelefonon fussanak. Ezek egyelőre többnyire kutatási modellek, de az Apple jövőbeli, készüléken futó MI-ajánlatainak alapját képezhetik.

 

Az Apple új MI-modelljei, amelyek gyűjtőnevükön „OpenELM”, azaz „Open-source Efficient Language Models”, vagyis nyílt forráskódú hatékony nyelvi modellek, jelenleg az Apple Sample Code License elérhetőek el a Hugging Face-en. Mivel a licencben vannak bizonyos korlátozások, nem biztos, hogy megfelel a nyílt forráskód általánosan elfogadott definíciójának.

A Microsoft Phi-3 modelljeinek célja valami hasonló: a nyelvi megértés és a feldolgozási teljesítmény hasznos szintjének elérése kis méretű, helyben futtatható MI-modellekben. A Phi-3-mini 3,8 milliárd paraméterrel rendelkezik, de az Apple OpenELM modelljeinek némelyike jóval kisebb, 270 millió és 3 milliárd paraméter között mozog nyolc különböző modellben.

Összehasonlításképpen a Meta Llama 3 családjában eddig megjelent legnagyobb modell 70 milliárd paramétert tartalmaz (és hamarosan érkezik egy 400 milliárdos változat is), az OpenAI 2020-as GPT-3 pedig 175 milliárd paraméterrel szállított. A paraméterek száma az MI-modellek képességének és összetettségének mércéjeként szolgál, de a legújabb kutatások arra összpontosítanak, hogy a kisebb MI-nyelvi modelleket ugyanolyanná tegyék, mint amilyenek a nagyobbak voltak néhány évvel ezelőtt.

A nyolc OpenELM-modell kétféle változatban létezik: négy „pretrained” (gyakorlatilag a modell nyers, next-token változata) és négy „instruction-tuned” (utasításkövetésre finomhangolt, ami ideálisabb az MI-asszisztensek és chatbotok fejlesztéséhez):

  • OpenELM-270M
  • OpenELM-450M
  • OpenELM-1_1B
  • OpenELM-3B
  • OpenELM-270M-Instruct
  • OpenELM-450M-Instruct
  • OpenELM-1_1B-oktatás
  • OpenELM-3B-Instruct

Az OpenELM 2048 tokenes maximális kontextusablakkal rendelkezik. A modelleket a RefinedWeb nyilvánosan elérhető adathalmazokon, a PILE duplikációkat eltávolító változatán, a RedPajama egy részhalmazán és a Dolma v1.6 részhalmazán képezték ki, amely az Apple szerint összesen mintegy 1,8 billió token adatot tartalmaz. A tokenek az adatok töredezett reprezentációi, amelyeket az AI nyelvi modellek használnak feldolgozásra.

Az Apple szerint az OpenELM esetében alkalmazott megközelítése egy „réteges skálázási stratégiát” tartalmaz, amely a beszámolók szerint hatékonyabban osztja el a paramétereket az egyes rétegek között, így nemcsak számítási erőforrásokat takarít meg, hanem a modell teljesítménye is javul, miközben kevesebb tokenen képzik. Az Apple által kiadott fehér könyv szerint ez a stratégia lehetővé tette, hogy az OpenELM 2,36 százalékos pontosságjavulást érjen el az Allen AI OLMo 1B modelljéhez (egy másik kis nyelvi modell) képest, miközben feleannyi előzetes tanuló tokenre van szükség.

open elm table
Az OpenELM és más, hasonló osztályba tartozó kis mesterséges intelligenciájú nyelvi modelleket összehasonlító táblázat az Apple OpenELM kutatási tanulmányából.

Az Apple kiadta a CoreNet kódját is, egy olyan könyvtárét, amelyet az OpenELM képzéséhez használt, és reprodukálható képzési recepteket is mellékelt, amelyek lehetővé teszik a neurális hálózati fájlok megismétlését, ami eddig szokatlan egy nagy technológiai cégtől. Ahogy az Apple az OpenELM dokumentumának kivonatában is írja, az átláthatóság kulcsfontosságú cél a vállalat számára:

„A nagyméretű nyelvi modellek reprodukálhatósága és átláthatósága kulcsfontosságú a nyílt kutatás előmozdítása, az eredmények megbízhatóságának biztosítása, valamint az adatok és a modell torzításainak, illetve a lehetséges kockázatoknak a vizsgálata szempontjából.”

A forráskód, a modellsúlyok és a képzési anyagok közzétételével az Apple szerint célja, hogy „képessé tegye és gazdagítsa a nyílt kutatóközösséget”. Ugyanakkor arra is figyelmeztet, hogy mivel a modelleket nyilvánosan hozzáférhető adathalmazokon képezték ki, „fennáll annak a lehetősége, hogy ezek a modellek a felhasználói kérésekre válaszolva pontatlan, káros, elfogult vagy kifogásolható kimeneteket produkálnak”.

Bár az Apple még nem integrálta az MI nyelvi modellek ezen új hullámát a fogyasztói készülékeibe, a közelgő iOS 18 frissítés (várhatóan júniusban a WWDC-n mutatják be) a pletykák szerint tartalmazni fog olyan új MI funkciókat, amelyek a felhasználói adatvédelem biztosítása érdekében a készüléken belüli feldolgozást használják – bár a vállalat esetleg a Google vagy az OpenAI megoldásaihoz fordulhat, hogy bonyolultabb, készüléken kívüli MI-feldolgozást végezzen, amivel a Siri régóta várt lendületet kaphatna.

(forrás)

 

További tartalmak

Legolvasottabb tartalmak

Strategy

Valós idejű adózás

Human

Az egészség hálózatai

Technology

Egy év, amely átírta az emberiség és a mesterséges intelligencia viszonyát

Strategy

Exportcikk lehet a DÁP-ból

ITBUSINESS heti hírlevél feliratkozás

.
Scroll to Top