PlayPendium
WordChess · Пища для размышлений

Как научить машину 149 000 слов на 22 языках

Словесной игре нужно больше, чем список допустимых строк. Ей нужно уметь сказать, что каждая из них значит, а значение хранить труднее всего.

Написано и отредактировано на английском языке. Эта русская версия создана машинным переводом; там, где важна точность, авторитетным остаётся английский оригинал. Читать оригинал на английском →

01 · Лемма и её тени

Одно слово и все формы, которые оно принимает

WordChess играется на доске 25×25 со словарём английского языка на 148 941 слово 6; средняя длина статьи — 8,6 буквы, а самые длинные доходят до 27. Это лёгкая часть. Список допустимых слов — просто набор строк, которые игра примет. Интересная часть — сказать игроку, что значит строка на доске, и сделать это сразу на двадцати двух языках.

Лексикографы проводят чёткую границу между леммой и её словоформами. Лемма — это заглавное слово, которое вы ищете в словаре: run («бежать»), house («дом»), be («быть»). Вокруг неё вращается парадигма поверхностных форм: runs, ran, running. Каждая несёт одно и то же основное значение, лишь одетое для иной грамматической роли. 3 Словарь тратит свои объяснения на лемму, а тени лишь указывают на неё.

Сколько теней отбрасывает слово, зависит от языка. Английский — аналитический язык: он опирается на порядок слов и маленькие служебные слова, так что у глагола редко бывает больше горстки форм. Финский — агглютинативный: он строит значение, приклеивая суффиксы к основе. Одно финское существительное изменяется примерно по пятнадцати падежам в единственном и множественном числе, а сверху ещё наслаиваются притяжательные окончания и клитики; на практике число различных форм исчисляется тысячами. 4 Венгерский упаковывает целую английскую фразу, in my house («в моём доме»), в одно слово — házamban. 5

02 · Словарь, который пишут все

Где живут определения

Определения берутся из Викисловаря — свободного словаря, который может править любой. Он огромен и многоязычен: проект насчитывает намного больше сотни активных языковых разделов и десятки миллионов статей, написанных совместно добровольцами, а не оплачиваемой редакцией. 1 Для игры, работающей на 22 языках, ни один другой свободный лексикон и близко не сравнится с ним по охвату.

Но охват на бумаге — ещё не охват, который можно вывести на экран. Викисловарь хранит словоформы так, чтобы редакторам-людям не приходилось писать одно и то же толкование десять тысяч раз. Вместо того чтобы излагать определение, статья о нелеммной форме содержит шаблон form-of («форма от») — маленький указатель, который по сути говорит: «это определённая грамматическая форма вот этой леммы». 2 Статья для smoulders («тлеет») — не текст, а шаблон, который отображается как «third-person singular simple present form of smoulder» («форма 3-го лица единственного числа простого настоящего времени от smoulder»). 1

Эти указатели — не погрешность округления. В английском Викисловаре из примерно 1,27 млн определений около 478 000 — намного больше трети — представляют собой определения типа «форма от», а не расписанные значения. 1 Данные есть. Просто они свёрнуты.

03 · Задача разбора, а не пробел в данных

Толкование — это развёрнутый шаблон

Так что важная проблема никогда не состояла в том, что «слова нет». Она состояла в том, что значение слова пряталось внутри шаблона, который наивный парсер просто выбросил бы. Определения WordChess построены путём чтения сырых дампов Викисловаря и развёртывания шаблонов словоизменения язык за языком: парсер учили, что означает каждый указатель, и переписывали его в простое толкование. 6

Каждый язык прячет свои формы за собственным механизмом. Испанский убирает глагольные формы за шаблон {{forma verbo}}, который разворачивается в «глагольная форма от X». Немецкий использует {{Grundformverweis Dekl/Konj}} для склоняемых и спрягаемых форм. Финский опирается на {{taivutusmuoto}}. Русский часто вообще не хранит шаблона формы: словоформа — это голое перенаправление (собаки → собака), по которому нужно пройти, чтобы восстановить толкование «форма от». 6 Обработайте каждое соглашение — и охват резко вырастет.

Охват определениями до → после развёртывания шаблонов
ЯзыкДоПослеПрирост
Немецкий45%92%+47
Нидерландский58%90%+32
Финский54%74%+20
Русский20%70%+50
Греческий15%57%+42

По проектной и сборочной документации этого проекта. Проценты — доля словарных статей, у которых есть пригодное определение или разрешённое толкование «форма от».

Данные никогда не пропадали. Они были свёрнуты в указатель, и дать машине слово означало научиться его разворачивать.

04 · Что значит для машины «знать слово»

Строка и предложение о ней

Стоит честно сказать, что теперь содержит игра. Когда WordChess показывает, что собаки — форма слова собака (по-английски dog), она ничего не поняла. Она сопоставила одну строку с другой строкой, толкованием, пройдя по тем же указателям, что оставил редактор-человек. Это лемматизация, рабочая лошадка обработки естественного языка: сведение поверхностной формы к её основе, чтобы машине приходилось отслеживать меньше различных сущностей. 7

Это настоящее и полезное знание. Оно позволяет игре ответить на вопрос «что это за слово?» в Афинах или Амстердаме без лексикографа в штате. Но это знание-как-поиск, а не знание-как-понимание. Толкование — это обещание, что человек, прочитав его, узнает слово. Машина хранит обещание; смысл привносит читатель.

Где проходит стена

Некоторые языки упираются в потолок, который не поднять никаким парсером, потому что данных, которые можно было бы развернуть, попросту нет. Венгерские статьи часто содержат лишь этимологию и таблицу переводов, без какого-либо текста определения, так что даже идеальный читатель уйдёт ни с чем. Самые трудные случаи скапливаются там, где труднее всего лингвистика: в агглютинативных языках, таких как финский и венгерский, порождающих огромные парадигмы, и в кириллице и греческом письме, где сообщество изначально покрывает меньше. Греческий поднялся с 15 % до 57 %; то, что он останавливается, далеко не дотянув до 92 % немецкого, — факт об источнике, а не о коде. 6

Sources & notes
  1. Wikipedia, "Wiktionary", scale, multilingual structure, collaborative editing, and the "form of" definition counts (including the smoulders example). en.wikipedia.org/wiki/Wiktionary
  2. Wiktionary, "Wiktionary:Form-of templates", how non-lemma entries point back to a lemma on the definition line. en.wiktionary.org/wiki/Wiktionary:Form-of_templates
  3. Wikipedia, "Lemma (morphology)", lemma as citation form; the paradigm of inflected forms. en.wikipedia.org/wiki/Lemma_(morphology)
  4. Wikipedia, "Finnish noun cases", the roughly fifteen cases, in singular and plural, before possessive suffixes and clitics stack on top. en.wikipedia.org/wiki/Finnish_noun_cases. Broader context: en.wikipedia.org/wiki/Finnish_grammar
  5. "Morphology of Different Languages," Psychology of Language (BCcampus Open Textbook), analytic vs. agglutinative typology; the házamban example. opentextbc.ca/psyclanguage/chapter/morphology-of-different-languages/
  6. WordChess definition pipeline, template-expansion rules per language (Spanish {{forma verbo}}, German {{Grundformverweis}}, Finnish {{taivutusmuoto}}, Russian redirects) and coverage figures. Measured from this project's design and build notes.
  7. Wikipedia, "Lemmatization", reducing inflected forms to a base form in NLP. en.wikipedia.org/wiki/Lemmatization
  8. Further reading on Wiktionary, [1011.1368] Transformation of Wiktionary entry structure into tables and relations in a relational database schema. arxiv.org.
  9. Further reading on Wiktionary, CEFR vocabulary level as a predictor of user interest in English Wiktionary entries. doi.org.
  10. Further reading on Lemmatization, BioLemmatizer: a lemmatization tool for morphological processing of biomedical text - PMC. ncbi.nlm.nih.gov.
Was this worth reading?
Play WordChess
PlayPendium · About · Contact · Privacy · Terms · Cookies · Accessibility · Copyright · Browse all games · Classic arcade games · © 2026