A publikációk feldolgozásának lehetőségei – Mit várunk a nyelvmodellektől?
Szinte egyik napról a másikra lett olyan természetes a különböző mesterséges intelligencia platformokkal beszélgetni, mint a levegővétel. Bár egyre többször kerül szóba, hogy az ilyen rendszerek szövegeken – többek között szkennelt dokumentumok alapján tanulnak, kevés szó esik arról, hogy a megfelelő korpusz építése önmagában milyen hatalmas feladat.
A szakkönyvtárak hosszú évek óta teszik közzé a tudományos publikációkat digitális könyvtárakban úgynevezett repozitóriumokban. Ezek megbízható, értékes forrásokat tartalmaznak. De vajon ezek a források megjelennek-e a mesterséges intelligencia által adott válaszokban?
Több százezer vagy akár több millió dokumentum feldolgozása ma már elképzelhetetlen gépi segítség nélkül. Ahhoz azonban, hogy a dokumentumok tartalmából megbízhatóan kereshető, összekapcsolható és a gépi feldolgozás számára alkalmas információ váljon, több egymásra épülő problémát kell megoldanunk.
Az első kihívást a szöveg kinyerése jelenti: a különböző korú, minőségű, nyelvű és elrendezésű dokumentumok megbízható gépi olvasása korántsem magától értetődő feladat. A következő lépés pedig talán még összetettebb: hogyan azonosítsuk és nyerjük ki automatikusan a publikációkban rejlő információkat és metaadatokat?
A nyelvmodellektől egyre inkább azt várjuk, hogy ebben segítsenek. De vajon mi, emberek mindig pontosan meg tudjuk mondani, mit kellene megtalálnunk? Egyértelmű-e, hol kezdődik és hol ér véget egy szerző affiliációja? Mi számít címnek vagy alcímnek? Az „összefoglaló” ugyanaz a dokumentumelem-e, mint az „absztrakt”? Mi történik, ha ugyanaz az információ többféle formában vagy több helyen is megjelenik?
A program során a tudományos publikációk digitalizálásának és strukturált feldolgozásának példáján keresztül járjuk körül, mit várhatunk a nyelvmodellektől, mi vezethet jó eredményre és ezek hogy használhatók fel további műveletekre.
A program online közvetítéséhez a következő Zoom-linkre kattintva lehet csatlakozni:
(Meeting ID: 971 7467 9618)
A program partner szervező intézménye az MTA Könyvtár és Információs Központ.
Only with Hungarian knowledge
Nem regisztrációköteles
Élő és utólag feltöltött videó