Машина допетрит
Искусственный интеллект подключили к чтению рукописей Петра Первого
Новый проект отечественных ученых — расшифровка рукописей Петра Первого с помощью искусственного интеллекта. За необычной инициативой — новый тренд, когда современные технологии помогают разгадывать тайны прошлого.
О проекте расшифровки рукописного наследия Петра Первого стало известно на круглом столе… по технологическому лидерству, состоявшемуся под эгидой Российского исторического общества. Как давняя история связана с новейшими технологиями? Вот контекст: Петр оставил после себя 200 млн рукописных страниц, исписанных «весьма своеобразным» почерком. Их пытаются издать уже более века, и всего насчитывается 13 томов, что составляет меньше половины от сохранившегося массива. Инициатор проекта — Сбербанк, его зампредседателя Александр Ведяхин пояснил: прочесть рукописи — задача отдельная и сложная, искусственный интеллект как раз может в этом помочь. Работы начнутся в нынешнем году, планируется даже организация хакатона (или конкурса для разработчиков). Словом, инициатива выглядит как завязка нового романа Дэна Брауна. Насколько искусственному интеллекту под силу такая задача?
Эксперты пока осторожно комментируют новость — слишком много неизвестных. Ну, к примеру, заведующий кафедрой Историко-архивного института РГГУ, известный специалист по источниковедению Евгений Пчелов лишь разводит руками: задача прочитать рукописи Петра — чисто палеографическая, с ней справится и человек.
— У Петра Первого действительно был своеобразный почерк, но я не могу сказать, что его невозможно прочесть. Сравните хотя бы с почерком Суворина или, скажем Крылова,— говорит эксперт.— Крылов сам иногда не мог прочитать то, что написал. А тексты Петра вполне читабельны. Вообще, любой профессиональный историк обязан знать палеографию (дисциплину, изучающую памятники древней письменности, особенности их прочтения.— «О»), уметь разбирать любые почерки любого века. Бывают сложные случаи? Бывают. Тут помогает консультация с коллегами. Но как в палеографическом деле может помочь «машина», мне пока неясно.
Ответ на наиболее интригующий вопрос, почему от Петра Первого остался такой значительный объем рукописей, тоже есть. По словам Евгения Пчелова, это особенность абсолютной монархии, когда все замыкается на государя. Записочки, письма… Столь же значительный объем рукописей остался, к примеру, от Екатерины Второй. Идея систематического издания рукописного наследия Петра родилась еще в XIX веке, само издание по разным причинам прерывалось, но все же продолжается и уже дошло до 1714 года.
— Тут надо понимать: историкам известны самые важные документы, относящиеся к Петру Первому,— говорит Евгений Пчелов.— Может ли найтись что-то еще? Возможно. Но вряд ли новые находки кардинально изменят наши представления о нем. Недавно ведущий специалист по петровской эпохе Евгений Анисимов опубликовал выдающуюся вещь — биохронику Петра. Анисимов расписал каждый день царя: что происходило, что тот делал. И это было сделано одним человеком, без применения искусственного интеллекта. При том что компьютеры полезны для историков, например, в определении вероятности авторства того или иного текста. Надо идти от задачи.
От задач, собственно, идут и зарубежные ученые, которые все чаще обращаются к искусственному интеллекту за помощью. Целую подборку таких примеров собрал европейский футуролог Ричард ван Хойдонк.
Один из самых известных кейсов — проект «Пифия» по восстановлению поврежденных древних текстов с помощью так называемых алгоритмов машинного обучения.
А вот достижение ученых из Массачусетского технологического института и лаборатории искусственного интеллекта Google: они разработали систему машинного обучения, способную переводить забытые языки. Эффективность системы продемонстрировали на примере линейного письма Б. Так называют форму критского письма, которая использовалась в эпоху микенской культуры; дешифровать найденные письмена удалось лишь в 1950–1953 годах. Так вот система машинного обучения смогла перевести эти письмена на греческий, да еще и довольно точно! Победа технологий над древними тайнами, правда, не окончательна. Оказывается, есть еще линейное письмо А, остающееся для историков загадкой, и вот до его дешифровки компьютер пока «не дорос». Специалистам вообще приходится признать, что новые технологии пока не всесильны. Вопрос времени?
— Необходимо разделять задачи, которые ставят перед искусственным интеллектом (ИИ),— считает директор по науке и технологиям Агентства искусственного интеллекта Роман Душкин.— Например, распознавание текста с помощью ИИ практикуется давно: нужно взять блок текста из рукописей, разметить его и показать так называемому ИИ-агенту как перевести его из отсканированного вида в машиночитаемый. Проще говоря, в символы. Когда ИИ-агент научится это делать, он сможет уже сам переводить страницы и помечать места, где встречается с затруднениями. Для современного состояния технологий задача простая. Но, к примеру, дешифровка древних текстов — это уже сложнее. Из образцов могу вспомнить попытку прочитать с помощью искусственного интеллекта знаменитый манускрипт Войнича, однако в целом такие случаи все еще редки.
Про манускрипт Войнича стоит рассказать отдельно. Сенсационное сообщение о том, что компьютерная программа, созданная в лаборатории искусственного интеллекта Университета Альберты (Канада), смогла дешифровать первое предложение этой загадочной рукописи, появилось несколько лет назад. По версии программы там сказано следующее: «Она дала рекомендации священнику, хозяину дома, мне и людям». Интригует? К сожалению, дальнейшего развития история не получила. Эксперты поясняют: искусственный интеллект пока не сравним с человеческим — отсюда и затруднения.
— Для тренировки ИИ-агента необходимо загрузить огромное количество образцов выполнения задачи,— объясняет Роман Душкин.— Есть генетические алгоритмы, способные помочь с зашифрованными текстами, для которых известен язык, но неизвестен метод шифрования. Есть символьные методы, они позволяют применять для дешифровки различные правила работы с текстом. Но в деле с манускриптом Войнича и другими похожими случаями у нас лишь один образец, про который мы ничего не знаем. К нему можно применять методы ИИ, основанные на обучении без учителя, чтобы, допустим, выявить скрытые закономерности. В идеале можно представить, как мы собрали десяток специалистов, узнали об их методах работы с древними текстами, формализовали все это в виде правил и загрузили свод этих правил в ИИ-агента… Тогда можно предположить, что он справится с дешифровкой. Но пока что это отдаленная перспектива.
А вот еще один удивительный поворот: ученые из Университета Ямагата и IBM (Япония) разработали алгоритм машинного обучения, способный выявлять скрытые… геоглифы. Этот алгоритм сразу доказал свою перспективность и смог обнаружить на знаменитом плато Наска новый геоглиф — пятиметровую фигуру человека, держащего трость или дубинку! Виртуальный Индиана Джонс? Такого поворота не смогли бы придумать даже в Голливуде.