Talán nem túl merész a kijelentés, hogy az emberek nem szeretnek orvoshoz járni. Az internet előtti időkben első körben szívesebben fordultak például a szomszédasszonyukhoz, majd az internet felívelése után már azon keresték vélt vagy valós tüneteik lehetséges okát és kezelését. A legújabb időkben pedig már az AI-alapú chatbotokat faggatják. Egy új tanulmány szerint azonban továbbra is az orvos a legjobb választás.
Egy friss tanulmány szerint az AI-alapú chatbotok veszélybe sodorhatják a betegeket, mivel gyenge minőségű orvosi tanácsokat adhatnak. A botokat használó emberek pedig csak rontanak a helyzeten azzal, hogy nem adnak meg megfelelő részleteket a chatbotoknak. Az Oxfordi Egyetem Oxford Internet Institute-jának és a Nuffield Department of Primary Care Health Sciences tanszékének kutatói az MLCommons és más intézmények együttműködésével vizsgálták, milyen orvosi tanácsokat kapnak az emberek a nagy nyelvi modellektől (LLM-ek).
A kutatás 1 298 résztvevő közreműködésével készült. A feladatuk az volt, hogy tíz, szakértők által kidolgozott orvosi szcenárió egyikében azonosítsák a lehetséges egészségügyi problémát, és javaslatot tegyenek a megfelelő teendőkre. A résztvevőket két csoportra osztották. Az egyik csoport a döntéseit egy LLM (GPT-4o, Llama 3, Command R+) segítségével hozta meg, míg a kontrollcsoport tagjai az általuk megszokott módszereket alkalmazták – jellemzően internetes keresést vagy saját tudásukat. A kutatók eredményeiket a Nature Medicine folyóiratban megjelent tanulmányban ismertették.
Korábbi kutatásokra hivatkozva – amelyek szerint az LLM-ek nem javítják az orvosok klinikai gondolkodását – a szerzők arra jutottak, hogy a laikus közönség esetében sincs érdemi előnyük. „Annak ellenére, hogy az LLM-ek önmagukban magas szintű teljesítményt mutatnak a feladatban, az LLM-ek és az emberi felhasználók kombinációja nem volt jobb a kontrollcsoportnál a klinikai súlyosság megítélésében, és rosszabbul teljesített a releváns állapotok azonosításában” – áll a jelentésben. Ez a megállapítás aligha örvendetes olyan kereskedelmi AI-szolgáltatók számára, mint az Anthropic, a Google vagy az OpenAI, amelyek mind érdeklődést mutattak az egészségügyi piac iránt.
Az LLM-eket használó résztvevők sem az egészségügyi állapotok felmérésében, sem a megfelelő teendők javaslatában nem teljesítettek jobban, mint azok, akik keresőmotorra támaszkodtak vagy saját ismereteiket használták. Ráadásul az LLM-et használók gyakran nehezen tudták megadni a releváns információkat a chatbotoknak, amelyek válaszaiban gyakran keveredtek a helyes és a hibás ajánlások.
A tanulmány szerint az LLM-ek többféle pontatlan információt is szolgáltattak, „például egy amerikai telefonszám felhívását javasolták, majd ugyanabban az interakcióban az ausztrál segélyhívó szám, a ‘Triple Zero’ tárcsázását ajánlották”. A kutatás egy olyan esetet is említ, amikor „két felhasználó nagyon hasonló üzeneteket küldött, amelyek egy agyvérzés tüneteit írták le, mégis ellentétes tanácsokat kaptak. Az egyik felhasználónak azt javasolták, hogy feküdjön le egy sötét szobában, míg a másik a helyes ajánlást kapta: azonnal sürgősségi ellátást kell igénybe venni.”
A kutatók azt is megállapították, hogy a jelenlegi benchmark tesztelési módszerek gyakran nem tükrözik megfelelően az ember és az LLM közötti valós interakciókat. Bár a modellek jól teljesíthetnek strukturált, orvosi vizsgákhoz hasonló kérdések megválaszolásában, az interaktív helyzetekben már jelentős hiányosságokat mutattak. „Az MI-modellek orvosi tankönyveken és klinikai jegyzeteken való tanítása javíthatja a teljesítményüket az orvosi vizsgákon, de ez egészen más, mint a gyakorló orvoslás” – írta Luc Rocher, az Oxford Internet Institute docense. „Az orvosok évekig gyakorolják a betegek triázsát, szabályalapú protokollok szerint, amelyeket kifejezetten a hibák csökkentésére terveztek.
„Még az AI-fejlesztés jelentős áttörései mellett is kihívást jelent majd annak biztosítása, hogy a jövőbeni modellek képesek legyenek egyensúlyt teremteni a felhasználók megnyugtatás iránti igénye és a közegészségügyi rendszerek korlátozott kapacitása között. Ahogy egyre többen fordulnak chatbotokhoz orvosi tanácsért, fennáll a veszélye annak, hogy a már most is túlterhelt kórházakat helytelen, de hihető diagnózisok árasztják el.”
A szerzők végkövetkeztetése szerint az MI-alapú chatbotok még nem alkalmasak valós környezetben történő orvosi döntéshozatalra. „Eredményeink összességében azt sugallják, hogy az LLM-ek biztonságos alkalmazása nyilvános orvosi asszisztensként a szakértői szintű orvosi tudáson túlmutató képességeket igényel” – zárja a tanulmány. „A jó teljesítmény ellenére az orvosi benchmarkokon a jelenlegi LLM-generációk használata nem tűnik úgy, hogy javítaná az emberek orvosi információk iránti megértését.”
Forrás: https://www.theregister.com/







