emLam - a Hungarian Language Modeling baseline

This paper aims to make up for the lack of documented baselines for Hungarian language modeling. Various approaches are evaluated on three publicly available Hungarian corpora. Perplexity values comparable to models of similar-sized English corpora are reported. A new, freely downloadable Hungarian...

Teljes leírás

Elmentve itt :
Bibliográfiai részletek
Szerző: Nemeskey Dávid Márk
Testületi szerző: Magyar Számítógépes Nyelvészeti Konferencia (13.) (2017) (Szeged)
Dokumentumtípus: Könyv része
Megjelent: 2017
Sorozat:Magyar Számítógépes Nyelvészeti Konferencia 13
Kulcsszavak:Nyelvészet - számítógép alkalmazása
Online Access:http://acta.bibl.u-szeged.hu/59000
Leíró adatok
Tartalmi kivonat:This paper aims to make up for the lack of documented baselines for Hungarian language modeling. Various approaches are evaluated on three publicly available Hungarian corpora. Perplexity values comparable to models of similar-sized English corpora are reported. A new, freely downloadable Hungarian benchmark corpus is introduced.
Terjedelem/Fizikai jellemzők:91-102
ISBN:978-963-306-518-1