<?xml version="1.0" encoding="UTF-8"?>
<xml>
 <records>
  <record>
   <ref-type name="Journal Article">17</ref-type>
   <contributors>
    <authors>
     <author>Скребцова Татьяна Георгиевна</author>
     <author>Гребенников Александр Олегович</author>
    </authors>
   </contributors>
   <titles>
    <title>Проблемы лемматизации художественного текста: нераспознанные слова в «Корпусе русского рассказа 1900-1930 гг.»</title>
   </titles>
   <keywords>
    <keyword>the Russian Short Story Corpus</keyword>
    <keyword>Корпус русского рассказа</keyword>
    <keyword>лемматизация</keyword>
    <keyword>морфоанализатор</keyword>
    <keyword>рассказ</keyword>
    <keyword>художественный текст</keyword>
   </keywords>
   <dates>
    <year>2026</year>
    <pub-dates>
     <date>2026-09-01</date>
    </pub-dates>
   </dates>
   <doi>10.33910/1992-6464-2026-219-269-279</doi>
   <journal>Известия Российского государственного педагогического университета им. А.И. Герцена</journal>
   <abstract>Введение. Несмотря на то что современные морфоанализаторы способны не только обращаться к словарю словоформ, но и сегментировать незнакомые единицы и выводить гипотетические леммы, некоторые словоформы при лемматизации художественного текста все равно не удается идентифицировать. Материалы и методы. В статье рассматривается проблема распознавания слов при автоматической обработке текстов на материале «Корпуса русского рассказа 1900-1930 гг.» (Корпуса) - представительного электронного корпуса, который содержит несколько тысяч текстов, написанных в России (а затем и в Советском Союзе) в первые три десятилетия XX века. Сопоставив данные частотного словаря для выборки из Корпуса с «Большим орфографическим словарем русского языка», мы получили список таких нераспознанных элементов для текстов русских рассказах начала XX века. Далее, попытавшись восстановить соответствующее исходное слово из текста и понять, почему оно не было распознано, мы идентифицировали типичные проблемы, с которыми сталкивается морфоанализатор при обработке литературных текстов. Результаты исследования. Нераспознанные элементы подразделяются на несколько групп: аббревиатуры и сокращения, имена собственные, сложные слова, а также стилистически маркированные лексемы и слова, содержащие латинские буквы. Многие из них не зафиксированы в толковых словарях русского языка. В статье приводятся статистические данные по количеству нераспознанных единиц в каждой группе и динамике соответствующих изменений за указанные три десятилетия. Показано, что это количество неодинаково в разные периоды. Общая тенденция состоит в увеличении числа таких слов от первого, довоенного периода, ко второму (военно-революционному) и третьему (раннесоветскому). Наиболее заметный рост нераспознанных словоформ наблюдается в рассказах, созданных в советский период. Выдвигаются гипотезы, призванные объяснить существенные расхождения в количестве нераспознанных слов по отдельным периодам: прежде всего, мы апеллируем к экстралингвистическим факторам, а именно к изменениям в общественно-политической обстановке. Заключение. Изменение окружающего мира неизбежно влечет за собой изменение языка, и именно рассказы, в силу их жанровой специфики, отражают эти изменения быстрее всего.</abstract>
   <urls>
    <web-urls>
     <url>https://rgpu.elpub.ru/publication/22867</url>
    </web-urls>
   </urls>
  </record>
 </records>
</xml>
