Профессия историка в эпоху искусственного интеллекта: новые возможности и новые вызовы

В ХХ веке наука испытала несколько технологических шоков, которые, как казалось современникам, могли радикально изменить характер профессии и поставить под вопрос креативность научного труда. ЭВМ, персональный компьютер – плод микрокомпьютерной революции, интернет – главные вехи на этом пути. Однако, пережив эти шоки, наука адаптировалась к ним, поставив на службу себе новый инструментарий и сохранив каждый раз приоритет ученого в новой научно-технологической парадигме. Появление первых технологий искусственного интеллекта (ИИ) в 1950-х годах и его развитие во второй половине ХХ века также воспринималось в этом ключе, но вторая волна ИИ, пришедшая во втором десятилетии XXI века, поставила перед наукой принципиально новые вопросы. И хотя сегодня часто можно слышать мнение о том, что нынешний рывок методов и технологий ИИ – просто новый этап в рассмотренном эволюционном ряду, с этим мнением трудно согласиться. Речь идет о серьезном изменении самой сути научной работы, о новом симбиозе человека и робота, о проникновении алгоритмов ИИ практически во все сферы научно-технологического развития и повседневной жизни человека. Для науки это означает новые возможности, но и новые вызовы. Еще больше изменений развитие ИИ принесло системе образования. В данной статье мы обратимся к вопросу о том, как этот процесс повлиял на историческую науку.
Применение методов и технологий искусственного интеллекта в исторических исследованиях берёт свое начало в 1980-х годах, когда историки приступили к апробации возможностей экспертных систем, когнитивных подходов к изучению исторических текстов, алгоритмов распознавания образов при изучении наскальных изображений и т. д.1 Период до конца ХХ века принято называть первой волной ИИ, затем последовали годы «зимы искусственного интеллекта», а с началом второго десятилетия XXI века пришла вторая волна, во многом связанная с прорывным развитием компьютерных технологий, больших данных2 и т. д. Основным направлением ИИ становятся искусственные нейросети, машинное обучение (включая глубокое обучение), генеративный искусственный интеллект, большие языковые модели (LLM)3. Этот процесс затронул и исторические исследования, сферу исторического образования. Так, на историческом факультете МГУ уже несколько лет все магистранты слушают семестровый курс по искусственному интеллекту, включающий лекции и практические семинары; открыта магистерская программа с этим же названием, профильный журнал «Историческая информатика» уже пять лет включает рубрику «Искусственный интеллект».
1. Бородкин Л. И. Методы искусственного интеллекта: новые горизонты исторического познания // Информационный бюллетень Комиссии по применению математических методов и ЭВМ в исторических исследованиях при Отделении истории Российской академии наук. 1992. № 5. С. 4—8. Бородкин Л. И. Наука о данных и технологии искусственного интеллекта: возможности и ограничения в исследованиях историков // Труды Отделения историко-филологических наук: Ежегодник. Т. 11 / Отв. ред. В. А. Тишков. М.: Изд-во РАН, 2022. С. 145—168. Юмашева Ю. Ю. К вопросу о применении искусственного интеллекта в исторических исследованиях // Историческая информатика. 2025. № 1 (51). С. 95—121.
2. Большие данные (Big Data) – огромные массивы информации, которые невозможно эффективно обрабатывать и анализировать с помощью традиционных методов из-за их размера, скорости поступления и разнообразия источников.
3. Большие языковые модели (LLM, ЯБМ) представляют собой глубокие нейронные сети, состоящие из миллиардов числовых параметров (или весов), которые настраивают отношения между словами и фразами; LLM представляют собой ИИ-модели, используемые популярными ИИ-ассистентами, такими как ChatGPT, Claude, Google Gemini и др.
Условно можно выделить два основных направления использования историками методов ИИ. Одно из них связано с распознаванием рукописных и старопечатных исторических текстов и их транскрибированием, Второе направление в большей мере связано с осмыслением новых методологических и этических проблем внедрения в исследовательскую практику больших языковых моделей, чат-ботов. Генеративный искусственный интеллект – это наиболее актуальный сегодня тип ИИ, который способен синтезировать (генерировать) текст, визуальный материал, отвечая на запрос пользователя (промпт). Генеративная нейросеть базируется на больших языковых моделях (LLM). Для историков актуальность использования таких нейросетей определяется в основном потребностями интеллектуального поиска нужной информации, задачами обработки и анализа исторических текстов и визуального материала, реконструкции историко-культурного наследия, визуальных образов прошлого в условиях неполной информации.
* * *
Однако вернемся к первому из указанных направлений, рассмотрим несколько проектов, реализованных в последние годы на основе машинного обучения. Актуальной задачей является распознавание отсканированных рукописных и старопечатных текстов – ведь ежедневно в мире делаются доступными пользователю тысячи страниц оцифрованных, но не являющихся машиночитаемыми источников, даже информационный поиск в таких случаях невозможен. Надо признать, что существующие методы распознавания знаков таких текстов пока еще не обладают достаточной степенью универсальности. Машинное обучение ориентируется, как правило, на распознавание текстов, написанных на определенном языке, в определенную эпоху, в той или иной форме письма.
Проект Digital Петр
В ходе работ по этому проекту, инициированному в 2020 году Российским историческим обществом (РИО) совместно со Сбербанком, были расшифрованы трудночитаемые рукописи Петра I. В качестве источника использовались различные письма и бумаги императора, которые ранее не были опубликованы. В работе над проектом приняла активное участие исследовательская группа Санкт-Петербургского института истории РАН. В основу источниковой базы были положены рукописи из собраний института и Российского государственного архива древних актов (РГАДА). Эта база была сформирована из материалов последних томов «Писем и бумаг Петра Великого», охватывавших период с 1709 по 1713 год.
Существенным итогом первого этапа работы стало размещение компьютерной программы по распознаванию петровских текстов (автографов) на сайте «Digital Петр» (https://www.sber.ru/ digital-petr/). На этом сайте пользователь может за несколько секунд получить в удобном и понятном формате расшифровку рукописей Петра Первого. Для тех, кто хочет понять принцип работы алгоритма, на сайте предусмотрен режим ознакомления и описание работы нейросети. Как отмечают разработчики сайта, посетители могут загрузить рукопись Петра I самостоятельно, а могут воспользоваться функцией расшифровки заранее заготовленных рукописей. Важным преимуществом созданной программы является гибкость, способность модели дообучаться на новом почерке, не требуя большого количества транскрибированных и размеченных данных (как правило, для этого достаточно нескольких страниц с новым почерком). Как отмечают участники проекта, создание отечественного программного обеспечения для распознавания и транскрибирования автографов Петра I откроет возможности для построения аналогичных моделей чтения русской скорописи XVI – начала XVIII веков.
