Az OmniParser V2 értelmezi a képernyőfotók elemeit

Microsoft
[Forrás: Gérard Julien]
A grafikus felhasználói felületek (GUI) automatizálása eddig komoly akadályokba ütközött, mivel az MI-alapú modellek számára nehézséget jelentett a képernyőelemek pontos értelmezése és az interakciók végrehajtása. Az egyik legnagyobb kihívás az volt, hogy az általános nyelvi modellek (LLM-ek) nem tudták megbízhatóan azonosítani a felhasználói interfészek interaktív elemeit, illetve nem értették azok funkcióit és helyes használatát. Erre a problémára kínál megoldást az OmniParser, amely képes a képernyőképeket feldolgozható, strukturált elemekké alakítani.

 

Az OmniParser lényegében egy „tokenizálási” folyamatot hajt végre a UI elemein. A pixelalapú képernyőképeket olyan értelmezhető egységekké bontja, amelyeket a nyelvi modellek fel tudnak dolgozni. Ez lehetővé teszi, hogy az LLM-ek pontosan meghatározzák, melyik elemhez milyen interakció kapcsolódik, és megfelelő lépéseket hajtsanak végre a GUI-n belül.

OmniParser V2 és OmniTool

A Microsoft szerint a legújabb, második generációs OmniParser V2 továbbfejlesztett verziója jelentősen javítja az interaktív elemek azonosításának pontosságát, különösen a kisebb ikonok esetében. Az új modell gyorsabb és hatékonyabb működést kínál, hála a kibővített tanítási adathalmaznak és az ikonok funkcionális leírására épülő fejlesztéseknek.

Az OmniParser V2 egyik kulcsfontosságú újítása az ikonfelirat-modell méretének csökkentése, amely révén 60 százalékkal csökkent a késleltetés az előző verzióhoz képest. Ennek köszönhetően az OmniParser+GPT-4o kombinációja új ipari mércét állított fel: a ScreenSpot Pro benchmark teszten 39,6-os átlagpontszámot ért el, míg a GPT-4o eredeti teljesítménye mindössze 0,8 volt.

omni
[Forrás: Microsoft]
Az egyszerűbb és gyorsabb fejlesztési folyamat érdekében létrehozták az OmniTool-t, egy Windows-alapú, konténerizált környezetet, amely számos korszerű MI-modellt támogat. Az OmniTool lehetővé teszi az OmniParser integrációját különböző nyelvi modellekkel, beleértve az OpenAI (4o/o1/o3-mini), DeepSeek (R1), Qwen (2.5VL) és Anthropic (Sonnet) modelleket. Az eszköz képes a képernyőértelmezés, az akciótervezés és a végrehajtás teljes folyamatát kezelni.

Kockázatok és biztonsági intézkedések

A Microsoft MI-elveihez és felelős mesterségesintelligencia-gyakorlataihoz igazodva az OmniParser fejlesztői különös figyelmet fordítottak az adatbiztonságra. Az ikonfelirat-modellt kifejezetten úgy tanították, hogy elkerülje az érzékeny személyes adatok, például vallási vagy etnikai hovatartozás felismerését. Emellett a fejlesztők azt javasolják, hogy az OmniParser-t csak olyan képernyőképeken alkalmazzák, amelyek nem tartalmaznak káros tartalmat.

A biztonság további növelése érdekében az OmniTool esetében kockázatelemzést végeztek a Microsoft Threat Modeling Tool segítségével, valamint egy elkülönített Docker-konténerben futó környezetet alakítottak ki. A fejlesztők biztonsági útmutatókat és példákat is biztosítanak a GitHub-on, és azt ajánlják, hogy a rendszer használata során mindig maradjon egy emberi ellenőrző személy a folyamatban.

Az OmniParser V2 és az OmniTool lehetővé teszi a nyelvi modellek számára, hogy hatékonyabban és pontosabban értelmezzék a képernyőelemeket. Az alacsonyabb késleltetés, a pontosabb felismerés és a beépített biztonsági intézkedések révén az OmniParser V2 egy ígéretes eszköz a fejlesztők és a MI-alapú GUI-automatizációs projektek számára.

További tartalmak

Legolvasottabb tartalmak

Strategy

Valós idejű adózás

Human

Az egészség hálózatai

Technology

Egy év, amely átírta az emberiség és a mesterséges intelligencia viszonyát

Strategy

Exportcikk lehet a DÁP-ból

ITBUSINESS heti hírlevél feliratkozás

.
Scroll to Top