Vektorokkal a hatékonyabb keresésért

Üzleti adatok kezelésére a relációs adatbázisok évtizedek óta megbízható, kiforrott megoldást kínálnak, mint ahogy a bennük való keresés is megoldott. A képi és szabad szöveges dokumentumokban való gyors keresés is működik a gépi tanulás algoritmusai által használt vektorbeágyazás révén. Az Oracle integrálta a kettőt, egészen új lehetőségeket nyitva meg az üzleti adatbázis-lekérdezésekben.


◼︎ Vektoros és strukturált adatok

A vektor vagy vektorbeágyazás a mesterséges intelligencia alkalmazásokban használt népszerű adatszerkezet. A vektor számok listája, amelyet a mélytanulási modellek generálnak különböző adattípusokból (képekből, dokumentumokból, videókból, egyebekből), hogy azzal kódolják az adott kép, videó stb. legfontosabb tulajdonságait, szemantikai jellemzőit.

Távolság és hasonlóság

Vegyük például egy családi ház fotóját! A vektorban szereplő minden egyes szám a ház egy-egy tulajdonságát írja le: az építőanyagát, az emeletek számát, a külső díszítéseket, a tető anyagát, annak szerkezetét. (Ez persze erős egyszerűsítés, a gépi tanulásos algoritmusok által választott jellemzőek sokkal bonyolultabbak is lehetnek.)

Mi az értelme az egésznek? A vektorok leírhatók egy kétdimenziós koordinátarendszer egy pontjaként, vagyis a példában szereplő ház elhelyezhető a vízszintes és függőleges tengely által bezárt terület adott pontjára. A többi, hasonló módon leírt ház ugyancsak ábrázolható a koordinátarendszerben. Minél közelebb helyezkedik el két ház egymáshoz, annál nagyobb a hasonlóság köztük.

Ugyanez megvalósítható szavakkal és dokumentumokkal is. Minél közelebb van két szó vektora egymáshoz, annál közelebb áll a jelentésük; ha pedig két dokumentum vektora található egymás közelében, azok tartalma hasonló. A dokumentumok vektoros keresése sokkal hatékonyabb lehet, mint a kulcsszóalapú keresés, mivel előbbi a szavak mögöttes jelentésén és a kontextuson alapul, nem pedig magukon a tényleges szavakon.

Az MI hatalma az adatbázisban

Az Oracle most ezt valósította meg adatbáziskezelőjének legújabb változatában, az Oracle Database 23 ai-ban: a szoftverbe új adatformátumként bekerültek a vektorok is, az adatbáziskezelő pedig kiegészült az AI Vector Search funkcióval, vagyis az üzleti felhasználók egyszerre kereshetnek a hagyományos adatokban és a vektorokban.

Ehhez az Oracle számos funkciót valósított meg az adatbázisban:

  • VECTOR adattípus a vektorbeágyazások tárolására;
  • új SQL-operátorok vektorbeágyazások generálásához strukturálatlan adatokból;
  • új SQL-operátorok és szintaxis a hasonlósági keresés egyszerű kifejezésére az üzleti lekérdezésekben;
  • korszerű vektorindexek a gyors közelítő kereséshez.

A VECTOR adattípus teljes mértékben integrálva van az SQL-be és a PL/SQL-be, és több kliens és programozási nyelv is támogatja, így az adatbázis-adminisztrátorok és az adatokkal foglalkozó más szakemberek villámgyorsan megtanulhatják használatát. Az AI Vector Search beépíthető a népszerű, harmadik féltől származó generatív AI keretrendszerekbe is, mint például a LangChainbe. Tartalmaz natív API-kat nagy nyelvi modellek REST hívásához tartalmak (például szövegek) generálásához és összegzéséhez, valamint egyéb MI-műveletekhez.

Oracle felhő az alagsorban

Számos, erősen szabályozott iparágban tevékenykedő vállalat találkozik azzal a kihívással, hogy adatainak meghatározott földrajzi határokon belül kell maradniuk, vagy szigorú biztonsági követelményeknek kell megfelelniük. Emiatt viszont nem vehetik igénybe a felhőtechnológia kínálta előnyöket.

A problémára már az Oracle is kínál gyógyírt: ez az Exadata Cloud@Customer. A megoldás lehetővé teszi a vállalkozások számára, hogy az Oracle-adatbázisokat saját adatközpontjaikban futtassák, miközben élvezik a felhő rugalmasságát, méretezhetőségét és költséghatékonyságát. A legfontosabb előnye, hogy használatával minden vállalati adat az ügyfél adatközpontjában, a tűzfalak mögött marad. Ugyanakkor a rendszer zökkenőmentesen integrálható a meglévő, helyben futó alkalmazásokkal. A vállalkozások „átemelhetik” jelenlegi munkaterhelésüket a felhőbe anélkül, hogy az alkalmazások vagy adatbázisok módosítására lenne szükség.

Ráadásul az Oracle autonóm adatbázis-technológiája automatikusan, valós időben, a munkaterhelés igényei alapján méretezi az erőforrásokat, így mindig optimális teljesítményt biztosít. Mindenhez még egyszerű kezelés és automatizálás is jár. A kiegészítő funkciókat (javítást, biztonsági mentést, helyreállítást) az Oracle felhőszolgáltatásai kezelik, csökkentve a házon belüli IT-csapatok működési terheit.

Az Oracle 23ai is elérhető az Exadata Cloud@Customer-én, így vektoros képességek is kihasználhatók felhő alapú modellben.

Ezek az új képességek lehetővé teszik a Retrieval Augmented Generation (RAG) zökkenőmentes támogatását: ez olyan áttörést jelentő generatív MI-technika, amely nagy nyelvi modelleket (LLM) egészít ki privát üzleti adatokkal. Ennek eredménye, hogy a vállalati chatbotok pontos, a céges üzleti adatokat is tartalmazó válaszokat adjanak a természetes nyelvi kérdésekre.

Mindezeket nagyvállalati szintű biztonsági és méretezhetőségi funkciók egészítik ki. A magas szintű rendelkezésre állásról és katasztrófatűrésről egyebek mellett a Data Guard, a Golden Gate, a Flashback vagy az RMAN gondoskodik. A biztonságot az Oracle Advanced Security kínálja, benne olyan funkciókkal, mint az átlátszó adattitkosítás, a Key Vault, az Audit Vault vagy a Virtual Private Database.

Végtelen lehetőségek

Mit jelentenek ezek a képességek a gyakorlatban? Az egyik lehetőség, hogy a szemantikus dokumentumkeresést kombináljuk a strukturált dokumentumtulajdonságokon végzett keresésekkel – azaz egyszerre lehet keresni a dokumentumok tartalmában és metaadataiban. Egy technológiai cikkeket tartalmazó adatbázisban feltehetjük a következő kérdést: „keressünk olyan cikkeket a nagy nyelvi modellek (LLM-ek) finomhangolásáról vállalati felhasználási esetekhez, amelyeket az elmúlt öt évben egy bizonyos szerző és egy bizonyos kiadó publikált egy bizonyos országban”. A kérdés megválaszolásához egyszerre kell keresni a cikkek szövegében, valamint azok attribútumaiban, amelyek ráadásul akár egyszerre több adattáblában is lehetnek tárolva.

Vagy visszatérhetünk a cikk elején említett családi házhoz. Létrehozhatunk egy olyan ingatlankereső alkalmazást, amelybe a felhasználó feltölti a neki tetsző ház fotóját, majd megadja a szokásos keresési feltételeket is (méret, szobák száma, ár, egyebek). Az app vagy szolgáltatás ezek után megkeresi neki mindazokat az eladásra szánt ingatlanokat, amelyek egyrészt a szemantikus tulajdonságok (a kinézet) alapján hasonlóak ahhoz, ami a felhasználónak tetszik, másrészt az egyéb jellemzőkben is a megadott értékek közé esik.

Ugyanezt a lehetőség, vagyis a kép és a strukturált vagy valós idejű tranzakciós adatok (gyártó, ár, elérhetőség) alapján történő egyidejű keresés megvalósítható a webáruházakban is. Az egyéb lehetőségek között van az MI-alapú digitális asszisztensek létrehozása; a tartalomalapú szűrés (személyre szabott ajánlások); adatelemzés (anomáliák észlelése, mintafelismerés); számítógépes látás (arcfelismerés, biometrikus azonosítás, objektumfelismerés); gyógyászati kutatások (gén- és DNS-hasonlósági kutatás, molekulaszerkezet-keresés); földrajzi információs rendszerek (térbeli elemzés, térképi megjelenítés); vagy ipari alkalmazások (minőség-ellenőrzés, prediktív karbantartás).

Bővebb információ.

47 Oracle logo red

További tartalmak

Legolvasottabb tartalmak

Strategy

Valós idejű adózás

Human

Az egészség hálózatai

Technology

Egy év, amely átírta az emberiség és a mesterséges intelligencia viszonyát

Strategy

Exportcikk lehet a DÁP-ból

ITBUSINESS heti hírlevél feliratkozás

.
Scroll to Top