A grafikus felhasználói felületek (GUI) automatizálása eddig komoly akadályokba ütközött, mivel az MI-alapú modellek számára nehézséget jelentett a képernyőelemek pontos értelmezése és az interakciók végrehajtása. Az egyik legnagyobb kihívás az volt, hogy az általános nyelvi modellek (LLM-ek) nem tudták megbízhatóan azonosítani a felhasználói interfészek interaktív elemeit, illetve nem értették azok funkcióit és helyes használatát. Erre a problémára kínál megoldást az OmniParser, amely képes a képernyőképeket feldolgozható, strukturált elemekké alakítani.
Az OmniParser lényegében egy „tokenizálási” folyamatot hajt végre a UI elemein. A pixelalapú képernyőképeket olyan értelmezhető egységekké bontja, amelyeket a nyelvi modellek fel tudnak dolgozni. Ez lehetővé teszi, hogy az LLM-ek pontosan meghatározzák, melyik elemhez milyen interakció kapcsolódik, és megfelelő lépéseket hajtsanak végre a GUI-n belül.
OmniParser V2 és OmniTool
A Microsoft szerint a legújabb, második generációs OmniParser V2 továbbfejlesztett verziója jelentősen javítja az interaktív elemek azonosításának pontosságát, különösen a kisebb ikonok esetében. Az új modell gyorsabb és hatékonyabb működést kínál, hála a kibővített tanítási adathalmaznak és az ikonok funkcionális leírására épülő fejlesztéseknek.
Az OmniParser V2 egyik kulcsfontosságú újítása az ikonfelirat-modell méretének csökkentése, amely révén 60 százalékkal csökkent a késleltetés az előző verzióhoz képest. Ennek köszönhetően az OmniParser+GPT-4o kombinációja új ipari mércét állított fel: a ScreenSpot Pro benchmark teszten 39,6-os átlagpontszámot ért el, míg a GPT-4o eredeti teljesítménye mindössze 0,8 volt.
Kockázatok és biztonsági intézkedések
A Microsoft MI-elveihez és felelős mesterségesintelligencia-gyakorlataihoz igazodva az OmniParser fejlesztői különös figyelmet fordítottak az adatbiztonságra. Az ikonfelirat-modellt kifejezetten úgy tanították, hogy elkerülje az érzékeny személyes adatok, például vallási vagy etnikai hovatartozás felismerését. Emellett a fejlesztők azt javasolják, hogy az OmniParser-t csak olyan képernyőképeken alkalmazzák, amelyek nem tartalmaznak káros tartalmat.
A biztonság további növelése érdekében az OmniTool esetében kockázatelemzést végeztek a Microsoft Threat Modeling Tool segítségével, valamint egy elkülönített Docker-konténerben futó környezetet alakítottak ki. A fejlesztők biztonsági útmutatókat és példákat is biztosítanak a GitHub-on, és azt ajánlják, hogy a rendszer használata során mindig maradjon egy emberi ellenőrző személy a folyamatban.
Az OmniParser V2 és az OmniTool lehetővé teszi a nyelvi modellek számára, hogy hatékonyabban és pontosabban értelmezzék a képernyőelemeket. Az alacsonyabb késleltetés, a pontosabb felismerés és a beépített biztonsági intézkedések révén az OmniParser V2 egy ígéretes eszköz a fejlesztők és a MI-alapú GUI-automatizációs projektek számára.








