Қазақ тiлiндегi жалқы есiмдердi тану

Авторлар

  • Z. M. Kozhirbayev "National Laboratory Astana" жеке мекемесі, Нұр-Сұлтан қ., Қазақстан http://orcid.org/0000-0003-4235-9049
  • Z. A. Yessenbayev "National Laboratory Astana" жеке мекемесі, Нұр-Сұлтан қ., Қазақстан http://orcid.org/0000-0002-6322-3848

DOI:

https://doi.org/10.26577/JMMCS.2020.v107.i3.06

Кілт сөздер:

жалқы есiмдердi тану, шартты кездейсоқ өрiс моделi, ұзақ қысқа мерзiмдi жады, сөздердiң векторлық көрiнiсi

Аңдатпа

Жалқы есімдерді тану (NER) табиғи тілді өңдеудің (NLP) маңызды тапсырмаларының бірі болып саналады. Бұл сөйлемде кездесетін географиялық атауларды, адамның есімдерин, ұйымның аттарын және т.б. сияқты нақты жалкы есімдерді танудың тәсілі. қолмен жасалған грамматикалық ережелер мен статистикалық модельдерге негізделген бірнеше тәсілдер бар, мысалы, жалқы есімдерді тану мәселесін шешуде машиналық үйрету және гибридтік әдістер. Бұл жұмыстың мақсаты - статистикалық тәсіл мен машиналық оқытуға негізделген әдістермен тәжірибе жасау және олардың агглютинативті қазақ тілімен қалай жұмыс жасайтындығын тексеру. Бұл жұмыста шартты кездейсоқ өріске (CRF) негізделген статистикалық тәсілмен қазақ тілінің жалқы есімдерін тану ұсынылған. Біз сондай-ақ екі бағытты ұзақ қысқа мерзімді жады (LSTM) негізіндегі нейрондық желі және CRF моделімен біріктіретін гибридтік әдісті қолданамыз. Бұл жалқы нысандарды танудың қазіргі заманғы тәсілі. Кросс-расталған рандомизацияланған іздеу моделі 0,95 f1 көрсеткішінде тоқтаса, LSTM-CRF гибридті моделі 0,88 f1 көрсетеді. Нәтижелер өте жақсы көрінеді және CRF моделімен салыстырғанда ешқандай дизайн ерекшеліктерін қажет етпейді. Тәжірибелер үшін NER тапсырмасына адамның есімі, географиялық атаулар, ұйым атаулары және басқалар сияқты белгілері бар корпус (kazNER) құрылды. Корпус 29629 сөйлемнен тұрады, олардың әрқайсысында кем дегенде бір жалқы есім бар.

Жүктеулер

Жарияланды

2020-09-30