A publikációk feldolgozásának lehetőségei – Mit várunk a nyelvmodellektől?

 

Szinte egyik napról a másikra lett olyan természetes a különböző mesterséges intelligencia platformokkal beszélgetni, mint a levegővétel. Bár egyre többször kerül szóba, hogy az ilyen rendszerek szövegeken – többek között szkennelt dokumentumok alapján tanulnak, kevés szó esik arról, hogy a megfelelő korpusz építése önmagában milyen hatalmas feladat.

A szakkönyvtárak hosszú évek óta teszik közzé a tudományos publikációkat digitális könyvtárakban úgynevezett repozitóriumokban. Ezek megbízható, értékes forrásokat tartalmaznak. De vajon ezek a források megjelennek-e a mesterséges intelligencia által adott válaszokban? 

Több százezer vagy akár több millió dokumentum feldolgozása ma már elképzelhetetlen gépi segítség nélkül. Ahhoz azonban, hogy a dokumentumok tartalmából megbízhatóan kereshető, összekapcsolható és  a gépi feldolgozás számára alkalmas információ váljon, több egymásra épülő problémát kell megoldanunk.

Az első kihívást a szöveg kinyerése jelenti: a különböző korú, minőségű, nyelvű és elrendezésű dokumentumok megbízható gépi olvasása korántsem magától értetődő feladat. A következő lépés pedig talán még összetettebb: hogyan azonosítsuk és nyerjük ki automatikusan a publikációkban rejlő információkat és metaadatokat?

A nyelvmodellektől egyre inkább azt várjuk, hogy ebben segítsenek. De vajon mi, emberek mindig pontosan meg tudjuk mondani, mit kellene megtalálnunk? Egyértelmű-e, hol kezdődik és hol ér véget egy szerző affiliációja? Mi számít címnek vagy alcímnek? Az „összefoglaló” ugyanaz a dokumentumelem-e, mint az „absztrakt”? Mi történik, ha ugyanaz az információ többféle formában vagy több helyen is megjelenik?

A program során a tudományos publikációk digitalizálásának és strukturált feldolgozásának példáján keresztül járjuk körül, mit várhatunk a nyelvmodellektől, mi vezethet jó eredményre és ezek hogy használhatók fel további műveletekre.

 

A program online közvetítéséhez a következő Zoom-linkre kattintva lehet csatlakozni:

https://zoom.us/j/97174679618   

(Meeting ID: 971 7467 9618)

 

 

 

A program partner szervező intézménye az MTA Könyvtár és Információs Központ.

Alkalmak
2026-09-25
15:00 - 16:00

Only with Hungarian knowledge

Nem regisztrációköteles

Élő és utólag feltöltött videó