Generatív-MI modellek vizsgálata az egészségügyben

A generatív mesterségesintelligencia-modelleket egyre gyakrabban vonják be az egészségügyi környezetbe. A korai alkalmazók úgy vélik, hogy felszabadítják a hatékonyság növelését, miközben olyan betekintéseket tárnak fel, amelyek egyébként kimaradnának. A kritikusok ugyanakkor rámutatnak, hogy ezek a modellek hibákkal és torzításokkal rendelkeznek, amelyek hozzájárulhatnak a rosszabb egészségügyi eredményekhez.

 

De vajon van-e kvantitatív módja annak, hogy megtudjuk, mennyire hasznos vagy káros egy modell, amikor olyan feladatokkal kell megbirkóznunk, mint a betegdokumentációk összegzése vagy az egészséggel kapcsolatos kérdések megválaszolása?

A Hugging Face, a mesterséges intelligenciával foglalkozó startup megoldást kínál az Open Medical-LLM nevű, nemrég közzétett tesztjében. Az Open Medical-LLM a nonprofit Open Life Science AI és az Edinburgh-i Egyetem Természetes Nyelvfeldolgozási Csoportjának kutatóival közösen létrehozott teszt célja, hogy szabványosítsa a generatív MI-modellek teljesítményének értékelését egy sor orvosi vonatkozású feladatban.

Az Open Medical-LLM önmagában nem egy újonnan létrehozott mérési metódus, hanem inkább meglévő tesztkészletek összefűzése, amelyek célja az általános orvosi ismeretek és a kapcsolódó területek – például az anatómia, a farmakológia, a genetika és a klinikai gyakorlat –modelljeinek vizsgálata. Az összehasonlító teszt olyan feleletválasztós és nyílt végű kérdéseket tartalmaz, amelyek orvosi gondolkodást és megértést igényelnek, és olyan anyagokból merítenek, mint az amerikai és indiai orvosi engedélyezési vizsgák és a főiskolai biológia tesztkérdőívek.

„Az Open Medical-LLM lehetővé teszi a kutatók és a gyakorlati szakemberek számára, hogy azonosítsák a különböző megközelítések erősségeit és gyengeségeit, további előrelépéseket tegyenek a területen, és végső soron hozzájáruljanak a betegek jobb ellátásához és eredményeihez”,

írta a Hugging Face egy blogbejegyzésben.

A Hugging Face a mérés eredményét az egészségügyhöz kötődő generatív MI-modellek „robusztus értékeléseként” pozicionálja. Néhány orvosi szakértő a közösségi médiában azonban óva intett attól, hogy túl sok pénzt fektessenek az Open Medical-LLM-be, nehogy az meggondolatlan bevetésekhez vezessen.

Az X-en Liam McCoy, az Albertai Egyetem neurológus rezidens orvosa rámutatott, hogy az orvosi kérdések megválaszolásának „mesterkélt környezete” és a tényleges klinikai gyakorlat közötti szakadék igen nagy lehet.

Clémentine Fourrier, a Hugging Face kutatója, valamint a blogbejegyzés társszerzője egyetértett.

„Ezeket a ranglistákat csak első közelítésként kell használni, hogy egy adott felhasználási esethez melyik generatív MI-modell vizsgálandó, de aztán mindig szükség van egy mélyebb tesztelési fázisra, hogy megvizsgáljuk a modell határait és relevanciáját valós körülmények között. Az orvosi modelleket semmiképpen sem szabad önmagukban használniuk a betegeknek, hanem inkább úgy kell képezni őket, hogy az orvosok támogató eszközeivé váljanak”,

válaszolta Fourrier az X-en.

Ez eszünkbe juttatja a Google tapasztalatait, amikor megpróbált egy mesterséges intelligenciával működő, a diabéteszes retinopátia szűrésére szolgáló eszközt bevinni a thaiföldi egészségügyi rendszerekbe. A Google létrehozott egy mélytanuló rendszert, amely a szemről készült képeket szkennelte, és a retinopátia – a látásvesztés egyik vezető oka – jeleit kereste. A nagy elméleti pontosság ellenére azonban az eszköz a valós tesztelés során nem bizonyult praktikusnak, és mind a betegeket, mind az ápolókat frusztrálta a következetlen eredményekkel és a helyszíni gyakorlatokkal való összhang általános hiányával.

Beszédes, hogy az Egyesült Államok Élelmiszer- és Gyógyszerügyi Hivatala által eddig jóváhagyott 139, mesterséges intelligenciával kapcsolatos orvosi eszköz közül egy sem használ generatív mesterséges intelligenciát. Rendkívül nehéz tesztelni, hogy egy generatív MI-eszköz laboratóriumi teljesítménye hogyan fog átkerülni a kórházakba és járóbeteg-rendelőkbe, és ami talán még fontosabb, hogyan alakulnak az eredmények az idő múlásával.

Ez nem jelenti azt, hogy az Open Medical-LLM nem hasznos vagy informatív. Az eredmények rangsora, ha másra nem is, de arra emlékeztet, hogy a modellek mennyire rosszul válaszolnak az alapvető egészségügyi kérdésekre. De az Open Medical-LLM, és egyébként semmilyen más referenciaérték nem helyettesítheti a gondosan átgondolt, valós körülmények között végzett tesztelést.

(forrás)

További tartalmak

Legolvasottabb tartalmak

Strategy

Valós idejű adózás

Human

Az egészség hálózatai

Technology

Egy év, amely átírta az emberiség és a mesterséges intelligencia viszonyát

Strategy

Exportcikk lehet a DÁP-ból

ITBUSINESS heti hírlevél feliratkozás

.
Scroll to Top