Словесной игре нужно больше, чем список допустимых строк. Ей нужно уметь сказать, что каждая из них значит, а значение хранить труднее всего.
Написано и отредактировано на английском языке. Эта русская версия создана машинным переводом; там, где важна точность, авторитетным остаётся английский оригинал. Читать оригинал на английском →
WordChess играется на доске 25×25 со словарём английского языка на 148 941 слово 6; средняя длина статьи — 8,6 буквы, а самые длинные доходят до 27. Это лёгкая часть. Список допустимых слов — просто набор строк, которые игра примет. Интересная часть — сказать игроку, что значит строка на доске, и сделать это сразу на двадцати двух языках.
Лексикографы проводят чёткую границу между леммой и её словоформами. Лемма — это заглавное слово, которое вы ищете в словаре: run («бежать»), house («дом»), be («быть»). Вокруг неё вращается парадигма поверхностных форм: runs, ran, running. Каждая несёт одно и то же основное значение, лишь одетое для иной грамматической роли. 3 Словарь тратит свои объяснения на лемму, а тени лишь указывают на неё.
Сколько теней отбрасывает слово, зависит от языка. Английский — аналитический язык: он опирается на порядок слов и маленькие служебные слова, так что у глагола редко бывает больше горстки форм. Финский — агглютинативный: он строит значение, приклеивая суффиксы к основе. Одно финское существительное изменяется примерно по пятнадцати падежам в единственном и множественном числе, а сверху ещё наслаиваются притяжательные окончания и клитики; на практике число различных форм исчисляется тысячами. 4 Венгерский упаковывает целую английскую фразу, in my house («в моём доме»), в одно слово — házamban. 5
Определения берутся из Викисловаря — свободного словаря, который может править любой. Он огромен и многоязычен: проект насчитывает намного больше сотни активных языковых разделов и десятки миллионов статей, написанных совместно добровольцами, а не оплачиваемой редакцией. 1 Для игры, работающей на 22 языках, ни один другой свободный лексикон и близко не сравнится с ним по охвату.
Но охват на бумаге — ещё не охват, который можно вывести на экран. Викисловарь хранит словоформы так, чтобы редакторам-людям не приходилось писать одно и то же толкование десять тысяч раз. Вместо того чтобы излагать определение, статья о нелеммной форме содержит шаблон form-of («форма от») — маленький указатель, который по сути говорит: «это определённая грамматическая форма вот этой леммы». 2 Статья для smoulders («тлеет») — не текст, а шаблон, который отображается как «third-person singular simple present form of smoulder» («форма 3-го лица единственного числа простого настоящего времени от smoulder»). 1
Эти указатели — не погрешность округления. В английском Викисловаре из примерно 1,27 млн определений около 478 000 — намного больше трети — представляют собой определения типа «форма от», а не расписанные значения. 1 Данные есть. Просто они свёрнуты.
Так что важная проблема никогда не состояла в том, что «слова нет». Она состояла в том, что значение слова пряталось внутри шаблона, который наивный парсер просто выбросил бы. Определения WordChess построены путём чтения сырых дампов Викисловаря и развёртывания шаблонов словоизменения язык за языком: парсер учили, что означает каждый указатель, и переписывали его в простое толкование. 6
Каждый язык прячет свои формы за собственным механизмом. Испанский убирает глагольные формы за шаблон {{forma verbo}}, который разворачивается в «глагольная форма от X». Немецкий использует {{Grundformverweis Dekl/Konj}} для склоняемых и спрягаемых форм. Финский опирается на {{taivutusmuoto}}. Русский часто вообще не хранит шаблона формы: словоформа — это голое перенаправление (собаки → собака), по которому нужно пройти, чтобы восстановить толкование «форма от». 6 Обработайте каждое соглашение — и охват резко вырастет.
| Язык | До | После | Прирост |
|---|---|---|---|
| Немецкий | 45% | 92% | +47 |
| Нидерландский | 58% | 90% | +32 |
| Финский | 54% | 74% | +20 |
| Русский | 20% | 70% | +50 |
| Греческий | 15% | 57% | +42 |
По проектной и сборочной документации этого проекта. Проценты — доля словарных статей, у которых есть пригодное определение или разрешённое толкование «форма от».
Данные никогда не пропадали. Они были свёрнуты в указатель, и дать машине слово означало научиться его разворачивать.
Стоит честно сказать, что теперь содержит игра. Когда WordChess показывает, что собаки — форма слова собака (по-английски dog), она ничего не поняла. Она сопоставила одну строку с другой строкой, толкованием, пройдя по тем же указателям, что оставил редактор-человек. Это лемматизация, рабочая лошадка обработки естественного языка: сведение поверхностной формы к её основе, чтобы машине приходилось отслеживать меньше различных сущностей. 7
Это настоящее и полезное знание. Оно позволяет игре ответить на вопрос «что это за слово?» в Афинах или Амстердаме без лексикографа в штате. Но это знание-как-поиск, а не знание-как-понимание. Толкование — это обещание, что человек, прочитав его, узнает слово. Машина хранит обещание; смысл привносит читатель.
Некоторые языки упираются в потолок, который не поднять никаким парсером, потому что данных, которые можно было бы развернуть, попросту нет. Венгерские статьи часто содержат лишь этимологию и таблицу переводов, без какого-либо текста определения, так что даже идеальный читатель уйдёт ни с чем. Самые трудные случаи скапливаются там, где труднее всего лингвистика: в агглютинативных языках, таких как финский и венгерский, порождающих огромные парадигмы, и в кириллице и греческом письме, где сообщество изначально покрывает меньше. Греческий поднялся с 15 % до 57 %; то, что он останавливается, далеко не дотянув до 92 % немецкого, — факт об источнике, а не о коде. 6