PULI LlumiX modell egy folytatólagosan előtanított nagy nyelvi modell /

Az utóbbi hónapokban a nagyméretű nyelvi modellek fejlesztése felgyorsult, ahogy egyre több technológiai vállalat törekszik különböző nyelvi feldolgozási feladatok megoldására alkalmas modellek létrehozására. Ebben a cikkben bemutatunk egy magyar nyelvre optimalizált, Llama-2 alapú modellt, amely fo...

Teljes leírás

Elmentve itt :
Bibliográfiai részletek
Szerzők: Yang Zijian Győző
Dodé Réka
Ferenczi Gergő
Hatvani Péter
Héja Enikő
Lengyel Mariann
Ligeti-Nagy Noémi
Madarász Gábor
Sárossy Bence
Varga Kristóf
Varga Tamás
Váradi Tamás
Testületi szerző: Magyar számítógépes nyelvészeti konferencia (21.)
Dokumentumtípus: Könyv része
Megjelent: Szegedi Tudományegyetem TTIK, Informatikai Intézet Szeged 2025
Sorozat:Magyar Számítógépes Nyelvészeti Konferencia 21
Kulcsszavak:PULI modell, Nyelvi modell, Nyelvészet - számítógép alkalmazása
Tárgyszavak:
Online Access:http://acta.bibl.u-szeged.hu/88779
Leíró adatok
Tartalmi kivonat:Az utóbbi hónapokban a nagyméretű nyelvi modellek fejlesztése felgyorsult, ahogy egyre több technológiai vállalat törekszik különböző nyelvi feldolgozási feladatok megoldására alkalmas modellek létrehozására. Ebben a cikkben bemutatunk egy magyar nyelvre optimalizált, Llama-2 alapú modellt, amely folytatólagos előtanítást és utasításkövető finomhangolást alkalmaz a magyar nyelvi sajátosságok figyelembevételével. A modell finomhangolásához egy 66 000 angol és 15 000 magyar promptot tartalmazó adatbázist használtunk, így a modell képes lett magyar nyelvű utasítások pontos követésére is. Az így létrejött modell különböző hazai benchmarkokon – köztük a HuCOLA, HuSST és HuRTE teszteken – kimagasló teljesítményt nyújtott, azero shot tesztek során a HuCOLA teszten 66,98%-os, a HuSST teszten 70,06%-os, míg a HuRTE teszten 74,54%-os pontosságot ért el, ami felülmúlja a korábbi modelleket. A kvantitatív eredmények mellett kvalitatív elemzéseket is végeztünk a modell teljesítményének mélyebb megértése érdekében. A modell magas szintű kontextuskezelő képességét például egy hosszú szövegkörnyezetben végzett keresési feladattal értékeltük, míg a stílusérzékenységét különböző nyelvi regiszterekben tett próbákkal vizsgáltuk. Eredményeink alátámasztják, hogy a transzfertanulás révén a modell jelentős tudást képes átvenni más nyelvekből is, javítva a magyar nyelvű teljesítményét.
Terjedelem/Fizikai jellemzők:153-167
ISBN:978-963-688-034-7