Как искусственный интеллект влияет на возможности исторического исследования

МонокльHi-Tech

Искусственный интеллект и Древняя Русь

Созданный на основе ИИ инструмент позволил историку в одиночку обработать источники в количестве, прежде посильном только научному коллективу, и прийти к нетривиальным выводам — как по поводу предмета исследования, так и его метода

Григорий Герасимов, доктор исторических наук

Прошлым летом Microsoft Research опубликовала исследование, которое можно было легко превратить в тревожный заголовок. Авторы проанализировали 200 тыс. обезличенных диалогов пользователей с Copilot и сопоставили реальные способы применения искусственного интеллекта с задачами сотен профессий. Первыми в перечне оказались переводчики, вторыми — историки. Писатели заняли пятое место, журналисты — шестнадцатое, редакторы — двадцать первое. Для историков с возможностями Copilot в той или иной степени пересекались 91% учтенных видов деятельности.

Это не был прогноз увольнений. Исследователи не изучали сокращение штатов, зарплаты или кадровые планы. Они измеряли, насколько отдельные операции уже поддаются автоматизации, и специально предупреждали: профессия — это не простая сумма действий. За чтением, поиском и письмом стоят знание предмета, выбор цели, понимание контекста и ответственность за вывод.

Но высокий показатель все равно важен. Историк работает прежде всего с текстами и информацией: ищет, читает, сравнивает, классифицирует, объясняет и пишет. Именно здесь языковые модели особенно сильны. Они могут за минуты просмотреть массив, на который человек потратил бы месяцы, и выполнить большую часть подготовительной работы.

Практической проверкой этой возможности стала база данных ИРИС — «Интеллектуальная реконструкция исторических смыслов». Один историк без профессиональной команды программистов превратил большой массив данных в связанную исследовательскую систему. Главный вопрос теперь звучит не так: «уволит ли ИИ историка?» — а так: «что сможет сделать один историк, получив инструменты целого коллектива?»

Источниковая база была не опытной подборкой из нескольких книг. Она включала Полное собрание русских летописей — тома 1–2, 4–16, 18–28, 31, 33–37 и 39–42; семнадцать томов «Библиотеки литературы Древней Руси»; пять выпусков «Памятников русского права»; первые три тома «Российского законодательства X–XX веков»; первые три тома Первого собрания Полного собрания законов Российской империи и отдельное издание Новгородской первой летописи. Иными словами, речь шла уже не о чтении нескольких памятников, а о попытке увидеть общую систему смыслов в большой и самой важной части письменного наследия Древней Руси.

Наиболее полное для своего времени летописно-хронологическое произведение Древней Руси: лицевой (иллюстрированный) свод, созданный в единственном экземпляре для Ивана Грозного. Фото: энциклопедия «РУВИКИ»

Невидимая половина профессии

Читателю работа историка представляется просто: найти документы, прочитать и написать книгу. В действительности между источником и выводом лежит длинный слой незаметного труда. Нужно собрать издания, разобраться в редакциях и составе многотомников, распознать страницы, исправить ошибки, отделить основной текст от примечаний, описать документ, разделить его на смысловые части, составить перечни имен, мест, событий и понятий, проверить исключения, найти цитаты и только затем переходить к обобщению.

До цифровой эпохи этот невидимый труд материализовался в тетрадях, карточках и коробках с выписками. Историк годами собирал собственную память о теме: одну карточку на имя, другую — на событие, третью — на цитату. Такая система могла быть глубокой, но почти всегда оставалась личной. Ее трудно было передать другому исследователю, проверить целиком или быстро перестроить под новый вопрос.

Здесь соединены две разные работы. Первая — ремесленная: повторяющиеся операции, которые можно описать правилом-алгоритмом. Очистить текст, перенести данные, найти совпадения, сгруппировать формулировки, подсчитать частоты, подготовить выборку сегодня может и скрипт. Вторая — исследовательская: поставить проблему, выбрать теорию, определить единицу анализа, отличить существенное от случайного, проверить источник и объяснить причины.

ИИ быстрее всего входит в первую область. Он не делает ее ненужной: ошибка в распознавании может исказить имя, неверная граница фрагмента — соединить тексты разных авторов, плохая классификация — породить несуществующую закономерность. Но машина способна повторять однажды сформулированное правило десятки тысяч раз. Поэтому она снимает старый выбор между глубиной и широтой: тщательно обработать небольшой корпус или поверхностно охватить большой.

Парадокс в том, что автоматизация требует от историка лучше понимать собственный метод. Нельзя поручить модели «найти идеи», пока не объяснено, чем идея отличается от темы, оценки или действия. Нельзя приказать «разделить текст», не определив, какая смысловая целостность должна сохраниться. Чем быстрее работает машина, тем дороже обходится неясный или неправильно сформулированный вопрос.

Поэтому ИИ не просто ускоряет старую процедуру. Он заставляет превратить индивидуальный навык в явную методику. То, что раньше историк делал «по опыту» и не всегда мог подробно объяснить, теперь приходится формулировать как правило. В этом смысле машина становится строгим собеседником: она быстро показывает, где понятие расплывчато, а критерий допускает противоположные решения.

Историк — ChatGPT — Codex

ИРИС возникла не из увлечения программированием. Ее исходной точкой стал идеалистический подход к истории — представление, что идеи формируют цели людей, превращаются в нормы, воплощаются в действиях и институтах и таким образом «делают историю». Чтобы проверить эту гипотезу на большом материале, требовалось не несколько удачных цитат, а способ обнаруживать идеи в десятках тысяч фрагментов и прослеживать их путь к исторической реальности.

Обычного разговора с ChatGPT для этого недостаточно. Чат может объяснить отдельный текст, но исследование должно помнить происхождение каждого фрагмента, применять одинаковые правила, сохранять промежуточные решения и позволять исправлять ошибки без потери исходных данных. Поэтому понадобились база данных и последовательность программ, соединяющих источник, разметку, словари и анализ.

Работа строилась в связке «историк — ChatGPT — Codex». Историк формулировал научную задачу и критерии правильного результата. ChatGPT помогал переводить методику в устройство базы и последовательность операций. Codex (программный модуль, входящий в состав ChatGPT и пишущий код) создавал и исправлял программы, обрабатывал файлы и готовил отчеты. Метод и программа развивались одновременно: новый смысловой вопрос мог потребовать изменить таблицу, правило разметки или весь аналитический слой.

Это не сделало историка программистом. Его новая роль — проектировщик исследования. Он должен уметь разложить замысел на проверяемые действия и распознать момент, когда технически безупречный результат научно бессмыслен. Раньше между идеей и работающим инструментом стояли бюджет, заявка и команда. Теперь опытную систему можно построить самостоятельно и сразу проверить на реальных источниках.

Разработка шла короткими циклами. Сначала ставилась содержательная задача, затем создавался небольшой рабочий модуль, после чего результат проверялся на реальных текстах. Если программа ошибалась технически, исправлялся код. Если она безошибочно выполняла неверно поставленную задачу, приходилось менять саму методику. Второй случай был важнее первого: машина нередко обнаруживала слабость исследовательского понятия раньше, чем это сделал бы научный оппонент.

Авторизуйтесь, чтобы продолжить чтение. Это быстро и бесплатно.

Регистрируясь, я принимаю условия использования

Открыть в приложении