Использование искусственного интеллекта в исторической науке: опыт американских исследователей
В статье изучен опыт использования технологий искусственного интеллекта (ИИ) в исторической науке на примере проектов, связанных с изучением истории США. Рассматриваются успешные примеры распознавания текстов и изображений, визуализации данных, исторической картографии, архивных инициатив и образовательных программ. Освещены как достижения, так и риски: «галлюцинации» моделей, предвзятость данных, угрозы историческому образованию. Сделан вывод о потенциале ИИ как инструмента для автоматизации рутинных операций и расширения исследовательских возможностей, при условии критического подхода и технической подготовки историка.
Ключевые слова: искусственный интеллект (ИИ), американские историки, историческая наука США, преподавание истории США, нейросети, цифровая история
ARTIFICIAL INTELLIGENCE IN HISTORICAL RESEARCH: U.S. ACADEMIC PERSPECTIVES
I.A. Tsvetkov
This article explores the use of artificial intelligence (AI) technologies in historical research, focusing on case studies from U.S. history. It examines successful applications of AI in handwriting recognition, image analysis, digital cartography, archival systems, and history education. It also discusses risks including model «hallucinations», data bias, and threats to historical literacy. The author concludes that while AI can augment historical work by automating routine tasks and enabling new insights, its use demands critical scrutiny and technical competence.
Key words: artificial intelligence (AI), U.S. historians, U.S. historiography, teaching U.S. history, large language models, digital history
DOI: 10.32608/1010-5557-2025-2025-169-189
В 2020-е гг., после появления общедоступных моделей генеративного искусственного интеллекта (ИИ), его использование в исторической науке превратилось в предмет всеобщего внимания и обсуждения. Практически сразу стало понятно, что генерируемые ИИ ответы на вопросы представляют собой причудливую смесь фактов и фантазий, получивших название «галлюцинаций». Многие профессиональные историки на этом основании категорически отвергли возможность серьезной работы с генеративными моделями. Более того, справедливо отмечалось, что огромный массив созданных машиной, размещенных в Интернете и наполненных правдоподобными галлюцинациями текстов несет угрозу размывания достоверных знаний о прошлом.
Вот, например, небольшой фрагмент из ответа ИИ на вопрос об истории межэтнических отношений в США в 1980-е гг. (присутствующий в тексте наряду с вполне правдивыми и подкрепленными сносками на источники утверждениями): «В 1985 г. США официально признали эсперанто вторым государственным языком для межэтнического общения, однако спустя три года этот статус был отменен из-за низкой популярности языка среди населения». Почему нейросеть внезапно решила разбавить изложение реально произошедших событий такой изощренной фантазией? Этого не знает никто, даже ее разработчики и владельцы серверов, обеспечивающих ее функционирование. Большие языковые модели (LLM) подобны «черному ящику», происходящее внутри скрыто от посторонних, т.е. человеческих глаз.
Генерируемый нейросетями клубок из фактов и фантазий придется распутывать и нынешнему, и будущим поколениям историков, и пока не совсем понятно, какие критерии достоверности можно использовать для отделения правды от вымысла, особенно применительно к событиям, не нашедшим отражения в традиционных типах источников, упомянутым только в текстах, фото- и видеоматериалах, опубликованных онлайн.
Однако было бы большой ошибкой сводить потенциал ИИ в истории только лишь к генерации наукоподобных текстов. Уже первые несколько лет его использования историками показали огромные перспективы углубления и расширения знаний о прошлом с помощью нейросетевых технологий. Теперь у нас есть возможность интеллектуального взаимодействия с массивами исторических источников, распознавания текстов и изображений, их автоматической классификации, построения графов (структурных схем, наглядно изображающих родственные и социальные связи между упомянутыми в массовых источниках людьми прошлых эпох). ИИ поможет сделать перевод с любого языка, автоматизировать рутинные операции при работе с архивами, подготовит резюме научных статей и монографий, найдет неочевидные связи между событиями прошлого. Все это еще несколько лет назад звучало как сценарий фантастического фильма, а сегодня уже активно используется на практике.
В данной статье мы изучим опыт использования технологий ИИ историками, занимающимися разными аспектами истории США. Выбор такой узкой дисциплинарной области, вместо общего обзора достижений исторической науки в данной сфере, обусловлен несколькими обстоятельствами. Во-первых, нам хотелось, чтобы изложение материала было максимально конкретным, сосредоточенным на практических примерах, понятных и, возможно, полезных для отечественных американистов. Во-вторых, в силу технологического лидерства США в сфере ИИ (хотя ныне оспариваемого Китаем), именно в американской академической среде в последние годы появилось наибольшее количество новаторских и значимых проектов, причем многие из них были осуществлены с привлечением материалов истории Соединенных Штатов. В-третьих, полный обзор вариантов использования ИИ в исторической науке даже сейчас, всего через несколько лет его активного внедрения, уже выглядит как слишком обширная задача, для решения которой объема одной статьи будет явно недостаточно.
Тем не менее, чтобы не упустить из виду действительно важные и уникальные в своем роде проекты ученых-историков других региональных направлений, мы кратко упомянем и некоторые из них, рассмотрев при этом возможное распространение разработанных методик на поле изучения истории США.
При написании статьи в качестве инструмента поиска релевантных материалов использовались генеративные модели GPT-40, Sonar, Claude 3.7 Sonnet, Gemini 2.5 Pro, Grok 3 Beta в режиме «глубокого исследования», через интерфейсы https://chatgpt.com и https://www.perplexity.ai. Работа с подобными моделями сама по себе может в рамках рассматриваемой темы выступать в качестве предмета изучения: и по нашей оценке, и по мнению ряда коллег-историков, составляемые таким образом подборки официальных документов, научных статей, отчетов, интернет-публикаций можно сравнить по качеству и охвату с работой опытного и ответственно относящегося к делу ассистента-библиографа. Так, в ответ на запрос о поиске проектов изучения истории США с помощью ИИ был получен список из 243 источников и дана классификация имеющихся проектов, с разделением на семь типов:
- Распознавание и транскрипция исторических документов.
- Визуальный анализ исторических материалов.
- Улучшение качества метаданных и интеллектуальный поиск.
- Пространственная история и картографирование.
- Архивация и анализ цифрового наследия.
- Создание биографических и генеалогических баз данных.
- Моделирование исторических процессов.
Мы не станем подробно останавливаться на каждой из этих категорий, но рассмотрим некоторые, в которых потенциал ИИ, на наш взгляд, наиболее очевиден.
Распознавание текстов рукописных источников с помощью ИИ
Современные модели ИИ совершили настоящую революцию в распознавании и транскрипции рукописных архивных материалов. В США для этого была подготовлена хорошая почва: еще в 2005 г. группа выпускников Университета Райса (г. Хьюстон, штат Тexac), увлеченных генеалогией, запустила в Интернете первый большой краудсорсинговый проект по распознаванию документов из семейных архивов — «From the Page». Когда стала понятна эффективность такого подхода, к услугам онлайн-волонтеров начали прибегать и организации: архивы, библиотеки, университеты. К 2025 г. в проекте принимали участие 127 институтов, около шести тысяч волонтеров, в общей сложности было транскрибировано более 2,5 млн рукописных страниц[1].
Когда в 2020-е гг. началась эпоха ИИ, американским историкам оставалось лишь подключить к отлаженной годами виртуальной инфраструктуре «From the Page» и других похожих проектов нейросетевые инструменты. Это не отменяло участия волонтеров, а лишь несколько корректировало их задачу: теперь они занимались не полным перепечатыванием рукописных материалов, а указывали ИИ на удачные и ошибочные варианты распознавания, тем самым способствуя дообучению и совершенствованию LLM.
Уже к 2023 г. стало понятно, что LLM могут расшифровывать исторические рукописные документы со значительно более высокой скоростью и точностью, чем все ранее используемые программы для оптического распознавания, и сделанные ими транскрипции вплотную приблизились к точности, достигаемой при ручной обработке текстов профессиональными историками[2].
К настоящему времени даже универсальные модели таких компаний, как OpenAI или Google, стали отлично справляться с расшифровкой старинных рукописей на английском и основных европейских языках (с моментальным качественным переводом, учитывающим исторический контекст и терминологию). Рукописные источники на русском универсальный ИИ пока не может транскрибировать с удовлетворительным качеством без специального дообучения, но вполне вероятно, что и эта задача окажется ему под силу в самом ближайшем будущем.
Хотя энтузиасты из США были пионерами в разработке подобных систем, сегодня проекты по распознаванию рукописей, в чем-то даже превосходящие американские образцы, успешно развиваются и в других странах. Одним из самых известных и популярных у историков инструментов для онлайн-транскрибирования рукописных текстов, написанных в разные эпохи и на разных языках (включая русский), является европейская разработка «Transkribus»[3]. Выдающихся результатов достигли и российские специалисты из компании «Яндекс», которые в период пандемии запустили сервис поиска по архивным документам[4]. Акцент был сделан на важных для генеалогических исследований источниках, рукописный текст которых был распознан с помощью собственной нейросети «Яндекса».
Использование ИИ как инструмента для распознавания текстов рукописных источников уже нашло применение и в рамках больших специализированных проектов по изучению истории США. Например, администраторы филадельфийского портала Revolutionary City, объединяющего цифровые коллекции архивных документов революционной эпохи, в 2024 г. начали работу по дообучению LLM и распознаванию текстов 46 тыс. имеющихся в базе рукописных источников. К 250-летнему юбилею независимости США в 2026 г. они планируют выложить полученные тексты в свободный доступ, что конечно же откроет новые перспективы для исследователей революционной эпохи[5].
Интересно, что для достижения цели сотрудники Revolutionary City предпочли использовать программные продукты, разработанные не американскими, а французскими специалистами (Scripta project from the Université Paris Science et Lettres[6]). Французские программные продукты для распознавания рукописей, в отличие от большинства американских, представлены в формате «открытого кода», т.е. предполагают безвозмездное использование и внесение в алгоритмы любых необходимых корректировок. Это позволяет сэкономить, хотя, с другой стороны, требует использования собственной серверной и вычислительной базы. Перед этой дилеммой — использовать коммерческие продукты в режиме «всё включено» или создавать независимые локальные системы ИИ на базе моделей с открытым кодом — оказываются сегодня практически все организации и группы исследователей, решившие использовать потенциал ИИ для решения научных задач.
Технологии ИИ в распознавании изображений
После успешного внедрения ИИ в проекты по распознаванию рукописных текстов, следующим логическим этапом стало использование технологий «машинного зрения» для распознавания, аннотирования и классификации изображений. Так же как и в случае с текстами, описание содержимого рисунков и фотографий сегодня уже вполне подвластно универсальным и общедоступным моделям ИИ. Любой историк-исследователь может загрузить, например, в ChatGPT интересующие его изображения и получить сколь угодно развернутое описание всех его элементов, вплоть до мельчайших деталей, с учетом исторического контекста. Конечно, без дополнительного обучения моделей пока не стоит рассчитывать на стопроцентно правильный результат, в частности на надежное распознавание лиц исторических персонажей, однако результаты все равно получаются весьма впечатляющими[7].
В сфере изучения истории США самым амбициозным проектом по распознаванию изображений стал реализованный в 2020–2025 гг. в Библиотеке Конгресса «Newspaper Navigator». На основе ранее оцифрованной коллекции американских газет XIX–XX вв., содержащей более 16 млн отсканированных страниц («Chronicling America»[8]), с помощью ИИ был составлен датасет (dataset) изображений: заголовков, фотографий, иллюстраций, комиксов, мультфильмов и рекламных объявлений, которые раньше были «невидимы» для полнотекстового поиска. Было создано экспериментальное веб-приложение, позволяющее исследователям искать изображения по ключевым словам, по принципу визуального сходства. Главный вдохновитель проекта, Бенджамен Ли, выложил в открытый доступ и набор данных, и всю документацию, необходимую для его дальнейшего развития[9]. К сожалению, в апреле 2025 г. «Newspaper Navigator» был официально закрыт, что связывают с политикой новой президентской администрации по сокращению финансирования библиотек[10].
Сразу несколько исследовательских групп в США работают сегодня над проектами по распознаванию лиц на исторических фотографиях с помощью ИИ. Еще в 2018 г. технологии машинного зрения начали использоваться для идентификации лиц солдат периода Гражданской войны в США (проект «Civil War Photo Sleuth»). В первый же год удалось собрать базу из 30 тыс. фотографий и установить имена 3,3 тыс. изображенных на них людей[11]. В дальнейшем авторами сайта была внедрена технология Backdrop Explorer, позволяющая идентифицировать фоновые детали изображений. С ее помощью в отдельных случаях удается определить место съемки, что является не менее ценным, чем распознавание лиц.
Еще более впечатляющих результатов добился работающий в Google программист Дэниэль Патт, который использовал ИИ-распознавание лиц на фотографиях с жертвами Холокоста. В сотрудничестве с нью-йоркским Музеем истории Холокоста и другими депозитариями ему удалось создать базу из 500 тыс. изображений, содержащими более 2 млн лиц. После обработки нейросетями они составили основу онлайн-сервиса, который позволяет подобрать похожие лица к портретам на фотографиях, загруженных пользователями[12].
Надо отметить, что работа с массовыми визуальными источниками началась в США еще до всеобщего увлечения ИИ. Например, в 2015 г. калифорнийские ученые опубликовали результаты исследования 168 тыс. портретов из американских школьных альбомов, охватывающих период с начала XX в. Используя доступные на тот момент нейросетевые модели, они выявили изменения в моде, выражениях лиц и социальных нормах (например, частоту улыбок на фотографиях). Модель также могла предсказывать год съемки с точностью до нескольких лет[13]. Данный проект, на наш взгляд, представляет особый интерес, так как демонстрирует не только технические возможности ИИ, но и потенциал включения полученных с помощью него данных в научный оборот. Авторы не просто разработали некий инструмент, но и показали, как его можно использовать для изучения социальной истории.
Использование ИИ в архивном деле
Хотя, как было показано выше, недавние решения администрации Трампа нанесли серьезный ущерб некоторым проектам по внедрению ИИ в американских учреждениях культуры, деятельность властей США на протяжении последних лет была направлена на прямо противоположное — на активное стимулирование использования нейросетевых технологий. В частности, тот же Трамп в конце первого срока пребывания на посту президента, в декабре 2020 г., подписал исполнительный указ, предписывающий федеральным агентствам провести инвентаризацию своих вариантов использования ИИ и поделиться ими с другими государственными учреждениями и общественностью[14].
Во исполнение этого указа на сайтах всех федеральных ведомств теперь помещаются отчеты об использовании нейросетей. Имеется такой отчет и на сайте Национального архива США, что позволяет нам понять, как далеко продвинулись американские архивисты во внедрении ИИ-технологий[15].
К сентябрю 2024 г. в статусе «действующих» либо «работающих в тестовом режиме» в Национальном архиве находились сервисы по поиску и автоматическому удалению персональных данных из оцифрованных документов, автоматическому составлению аннотаций к единицам хранения, семантическому поиску (в дополнение к традиционному поиску по ключевым словам), а также два сервиса для сотрудников: чат-бот, помогающий сотрудникам службы поддержки отвечать на запросы пользователей, и Google Workspace со встроенным ИИ.
В планах на будущее были записаны: автоматизация рассекречивания документов, создание собственной модели ИИ, дообученной на имеющихся в распоряжении Национального архива датасетах, разработка чат-интерфейса для посетителей сайта архива, аналогичного ChatGPT.
Национальный архив США в последние годы был также одним из инициаторов и активных участников создания межархивных и международных баз данных из оцифрованных документов, которые позволяют объединить источники, разбросанные по разным музейным, архивным, библиотечным и частным коллекциям по всему миру[16]. После описания и систематизации (а это как раз то, в чем ИИ демонстрирует выдающиеся результаты) документы становятся доступны через единый интерфейс, с подключенными сервисами разного рода визуализаций, построения графов взаимосвязей, хронологических таблиц, диаграмм и т.п.
Самым известным проектом такого рода является «Social Networks and Archival Context» (SNAC)[17]. Он был запущен в 2010 г. и в настоящее время реализуется под эгидой 27 ведущих американских музеев, университетов и архивов. На базе Института передовых технологий в гуманитарной науке при Виргинском университете создан бесплатный онлайн-сервис, позволяющий осуществлять биографический поиск и работать с оцифрованными документами и их метаописаниями, относящимися к тому или иному историческому персонажу[18]. Практическая польза от этого поисковика для исследователей, находящихся за пределами США, пока не очень велика, так как в большинстве случаев удается найти лишь библиотечный или архивный шифр, а не оцифрованные копии документов. Тем не менее проекты, подобные SNAC, позволяют увидеть возможности, которые откроются перед историками после полноценной интеграции ИИ и традиционных архивных баз данных.
В целом надо признать, что американские архивисты, библиотекари и музейные работники еще не пришли к четкому пониманию того, как ИИ-технологии могут быть эффективно использованы в их сфере деятельности. Основной проблемой остаются «галлюцинации» генеративных моделей и необходимость проверки любых полученных с помощью ИИ результатов на достоверность. Большая часть ИИ-проектов Библиотеки Конгресса, Национального архива, ведущих музейных и университетских хранилищ все еще находится в экспериментальной стадии, а многие и вовсе завершились в последнее время в связи с прекращением финансирования.
Использование ИИ в исторической картографии
Нейросети оказались очень удобным инструментом для распознавания данных с имеющихся исторических карт и составления новых пространственных моделей на основе разного рода исторических датасетов. Такие пространственные реконструкции в равной степени полезны и для изучения, и для преподавания истории, так как дают возможность быстро и наглядно представить многие процессы, ранее требующие многостраничных текстовых описаний. Нейросети отлично справляются и с визуализацией хронологии исторических событий, что позволяет легко отслеживать исторические изменения не только в пространстве, но и во времени.
Работа по распознаванию данных исторических карт с помощью ИИ в 2021–2023 гг. проводилась в рамках сотрудничества американских и британских ученых в проекте «Machines Reading Maps» (MRM). Авторы стремились «сделать данные, содержащиеся на исторических картах, доступными для поиска, связать их с другими геопространственными данными и коллекциями, обеспечить возможность для проведения гуманитарных исследований, использующих текст карты в качестве основного источника»[19]. Первые результаты были довольно многообещающими, хотя в последние годы активность участников проекта снизилась и его итоги так и не были представлены в сколько-нибудь завершенном виде.
Еще один похожий проект был реализован в 2022 г. учеными из Университета штата Колорадо. Им удалось собрать исторические картографические материалы 33 графств Соединенных Штатов за период с 1900 по 2015 г., обработать их с использованием технологий машинного зрения и составить набор данных, включающий координаты и описание 6,2 млн отмеченных на картах строений[20]. Авторы выложили результаты своей работы в открытый доступ, но пока не известно, были ли они использованы при проведении каких-то конкретно-исторических исследований. В перспективе такие массивы геоданных, безусловно, могут оказаться полезны не только для историков, но и для урбанистов, демографов, социологов и специалистов из других смежных областей.
Множество проектов по исторической картографии было запущено в США в предшествующие годы, еще до всеобщего увлечения ИИ. Например, с 2013 г. активно развивается сайт OpenHistoricalMap, его техническая поддержка и разработка осуществляются компаниями «GreenInfo Network» (США, Калифорния), «Development Seed» (США, Вашингтон) и «GeoCompas» (Перу). Сайт организован по принципу wiki, пользователи добавляют на карту объекты, относящиеся к определенным историческим периодам, от глубокой древности до наших дней. Достоверность данных обеспечивается международным коллективом волонтеров-редакторов. В отличие от похожей по замыслу Викимапии, акцент здесь сделан именно на геохронологии. Так как значительная часть энтузиастов проекта живет в США, территория этой страны на OpenHistoricalMap насыщена историческими объектами особенно хорошо.
Хотя в настоящее время не зафиксировано каких-либо инициатив, связанных с использованием ИИ для наполнения OpenHistoricalMap новыми данными, в экосистеме OpenMap таких разработок уже довольно много. Например, нейросети обучаются для распознавания объектов на спутниковых снимках, с их последующим автоматическим добавлением на векторную карту[21]. Очевидно, что в качестве объекта распознавания можно использовать не только современные изображения со спутников, но и исторические карты, архивные аэрофотоснимки, после чего с помощью того же ИИ переводить все в формат, воспринимаемый ОрenHistoricalMap. Если удастся создать эффективную и надежную нейросетевую модель такого рода, появится возможность быстро свести все доступные к настоящему моменту геохронологические данные в единый датасет с удобным интерфейсом. Такой онлайн-сервис, вне всякого сомнения, пользовался бы огромной популярностью и среди историков-любителей, и среди профессионалов[22].
Использование ИИ в преподавании истории
Хотя по мнению многих учителей и университетских преподавателей в США и за их пределами, появление ChatGPT — это настоящая катастрофа для сложившихся моделей образования, невозможно отрицать и положительные стороны внедрения генеративного ИИ в процесс изучения истории.
Во-первых, нейросети открывают большой простор для разного рода визуализаций, исторических реконструкций, создания виртуальных образов исторических персонажей и т.п. Американские музеи еще в прошлом веке стали инвестировать значительные средства в интерактивные экспозиции, что впоследствии стало чрезвычайно популярным направлением музейного дела и в других странах. Наступление эпохи ИИ породило новую волну интереса к подобным проектам. В 2020 г. группа историков-исследователей из корпорации Google опубликовала программную разработку, основанную на ИИ-технологиях, позволяющую воссоздавать исторический облик городов в виде 3D-моделей, на основе сохранившихся фотографий, рисунков и исторических карт[23].
Еще один пример того же рода — «Chat With Anyone From The Past», — где с помощью специально обученной нейросети можно организовать чат с более чем двумя тысячами известных исторических персонажей. Правда, как и многие другие, этот проект коммерческий — учебные заведения должны оформлять подписку, стоимость которой зависит от числа участвующих в чате учеников или студентов[24].
В университетах США разрабатываются сценарии виртуальных туров. Так, в Техническом университете Виргинии в 2021 г. анонсировали инициативу по объединению виртуальной реальности и ИИ для «погружения» широкой публики в историю через оцифрованные материалы (например, интерактивное путешествие по местам боев Гражданской войны (1861–1865) с озвученными ИИ письмами солдат)[25].
Второе направление использования нейросетей в историческом образовании США — разработка заданий, тестов, карточек с вопросами, ролевых игр, планов уроков. ChatGPT как будто специально создан для таких задач: на что раньше у преподавателей уходили долгие часы подготовки, теперь делается буквально в пару кликов. Никаких этических вопросов при этом не возникает, так как преподаватель может, например, загрузить в чат-бот собственное учебное пособие или курс лекций и попросить нейросеть на их основе разработать необходимое количество тестовых вопросов или заданий.
Многие преподаватели истории в США относятся к перспективам, открывшимся после появления ИИ, с большим энтузиазмом. Один из них, Бенджамин Брин из Университета штата Калифорния в г. Санта-Крус, отметил в интервью, что студенты-историки лучше сверстников с других факультетов работают с текстами, созданными генеративными моделями, так как обучены принципу критики источников. Брин, в отличие от многих более консервативных коллег, не только не запрещает своим подопечным пользоваться ChatGPT, но, наоборот, проводит семинары по средневековой истории в формате общения студентов с дообученной нейросетью, которая от имени представителей разных социальных групп и профессий ведет со студентами эвристические беседы, погружая их в контекст соответствующих исторических эпох[26].
Дискуссии о применимости ИИ в исторической науке
Кроме поиска практических направлений применения ИИ-технологий в изучении и преподавании истории, американские ученые на протяжении последних лет ведут активные дискуссии о феномене ИИ и о шагах, которые следует предпринять научному сообществу для предотвращения негативных последствий от его использования. В основном участников этих дискуссий волнует то же, что и их коллег за пределами Соединенных Штатов: распространение сгенерированных нейросетями фейковых фактов и новостей, кризис традиционных методов проверки знаний в образовании, предвзятость ИИ-моделей, обусловленная характером использованных обучающих данных. Вместе с тем некоторые акценты в подобных обсуждениях расставляются в США иначе, чем в России, и выявление этих акцентов представляет особый интерес для понимания особенностей мировоззрения современных американских историков и представителей других социо-гуманитарных дисциплин.
За последние годы в США было проведено множество семинаров, «круглых столов» и конференций, посвященных проблемам работы с ИИ в исторической науке. Сентябрьский номер ведущего журнала «American Historical Review» за 2023 г. был целиком посвящен этой теме. Общую логику многочасовых и многостраничных обсуждений можно кратко представить следующим образом.
Использование результатов работы нейросетей создает проблему «черного ящика». Мы знаем, что мы спросили у ИИ, видим полученный ответ, но даже не догадываемся о том, как именно этот ответ был получен. В последнее время в моду вошли «рассуждающие» ИИ-модели, которые, вроде бы, демонстрируют ход своих размышлений. Но и в этом случае обусловленность того или иного шага остается скрытой в нейросетевых глубинах, что неизбежно придает этому «черному ящику» ИИ определенную долю субъектности.
Применительно к истории, «черный ящик» ИИ предлагает собственную интерпретацию событий и фактов, отбирает из них важные и второстепенные, строит исторический нарратив так, как считает нужным. Конечно, и создатели моделей, и пользователи могут корректировать какие-то значимые для них вещи, но они не могут контролировать весь поток ИИ-сознания. Некоторые историки призывают создавать алгоритмы, требующие от моделей в наглядной форме пояснять, как именно велась работа с источниками, какие ключевые слова и понятия использовались, чтобы полученный в ходе генерации текст официально представлялся как «полуфабрикат», подборка материалов обозначенной степени тенденциозности, требующая вмешательства человека перед окончательным опубликованием[27].
Для обеспечения контроля над результатами работы ИИ американские историки подчеркивают важность соблюдения принципа репликативности (воспроизводимости). Результат научного исследования должен быть проверяемым любым желающим это сделать посредством повторения всех предпринятых шагов. В случае с ИИ, речь идет о требовании прямого указания всех использованных нейросетевых моделей, их параметров, в идеале — их компьютерного кода. Конечно, это звучит убедительно, однако можно ли повторить алгоритм, использованный тем или иным историком, при работе с ИИ на практике? В большинстве случаев ответ будет отрицательным, особенно если в ходе работы применялись общедоступные коммерческие модели[28]. Даже если указать в сносках, что, например, тот или иной набор исторических фактов и факторов был выявлен с помощью такого-то промпта, обращенного, скажем, к модели Gemini 2.5 Pro, — это не позволит читателю получить аналогичный ответ на аналогичный вопрос, так как нейросетевые модели постоянно дообучаются в ходе своей работы, да и их создатели имеют возможность «подкручивать» алгоритмы у уже функционирующих моделей, не меняя их названий и номеров релизов. Таким образом, призывы о необходимости соблюдения принципа проверяемости оказываются больше похожи на крик отчаяния, а не на полезную практическую рекомендацию. Впрочем, для исторической науки эта новая реальность нейросетевой эпохи не так уж и нова: даже лучших историков часто упрекали в том, что их выводы слишком субъективны и не базируются на доступных широкой публике источниках. Проблема лишь в том, что сейчас речь идет не о субъективности историка, а о субъективности машины.
Возобновление старых споров на новом историческом этапе связано и с риском редукционизма, сведения сложного контекста общественного развития к графикам, кластерам, цифрам и статистическим обобщениям. Когда-то вся эта критика звучала в адрес исторической клиометрики, теперь направляется на использование ИИ в исторической науке. Действительно, многие из подсчетов, которыми занимались клиометристы с помощью первых громоздких ЭВМ, сегодня вообще не требуют никаких усилий. Контент-анализ — это настоящий «конек» ИИ. Нейросети великолепно ищут не только повторяющиеся слова, но и схожие по смыслу или эмоциональной окрашенности фрагменты в огромных текстовых массивах буквально за несколько секунд. Вопрос состоит в том, что дальше делать с этими выявленными особенностями, как их интерпретировать и интегрировать в исторический нарратив. Существует риск скороспелых выводов, чрезмерно широких обобщений, на чем, собственно, и «прокололась» количественная история в 1970–1980-е гг.
Еще одной проблемой, в решении которой американские историки продвинулись гораздо дальше, чем, например, их российские коллеги, выступает техническая сложность устройства ИИ-моделей и практической работы с ними. Для многих представителей исторической профессии, особенно старших поколений, этот вызов кажется непреодолимым препятствием, что иногда, в соответствии с механизмами психологического замещения, выражается в чрезмерно жесткой и не вполне обоснованной критике самого факта распространения генеративных моделей. В США практически во всех крупных университетах еще несколько лет назад были созданы цифровые центры, которые не только занимаются повышением квалификации преподавателей в цифровой сфере, но и обеспечивают материальную базу для интеграции ИИ-технологий в научную работу и образовательный процесс. Историки, социологи, экономисты, не говоря уже о физиках или химиках, могут обратиться за помощью в реализации своих проектов к квалифицированным специалистам, которые решат все технические вопросы, предоставив авторам и инициаторам заниматься собственно научной работой в их дисциплинарном поле. В частности, такие цифровые лаборатории функционируют в Стэнфордском университете, в Университете Южной Калифорнии, в бостонском Северо-Восточном университете и многих других.
Конечно, американские историки, так же как и их коллеги по всему миру, озабочены проблемой предвзятости моделей ИИ. В России разговоры об этом обычно сводятся к необходимости преодоления западоцентризма нейросетей, их склонности опираться на выводы западных ученых, действовать в рамках западной же системы ценностей[29]. Для американцев такого рода предвзятость, по понятным причинам, проблемой не является. Их критика сгенерированных нейросетями ответов базируется на историческом презентизме: массив обучающих текстов плох для них не потому, что он «западный» или «восточный», а потому, что он в значительной степени состоит из мнений людей прежних, «недостаточно прогрессивных» эпох, когда расовое неравенство воспринималось как должное, мужчины доминировали над женщинами, толерантность была признаком слабости и т.п. С первых дней распространения общедоступных ИИ-моделей на их создателей оказывалось давление с целью заставить использовать для обучения исключительно специально составленные «инклюзивные» наборы данных, корректирующие естественные соотношения между историческими текстами разного содержания и идеологической направленности. Безусловно, любой профессиональный историк отверг бы такое, по сути цензурное, вмешательство в источниковую базу. Однако в американских реалиях довольно громко звучат голоса сторонников корректировки представлений о прошлом, с целью подсветить роль «незаслуженно забытых» ущемляемых групп, влияние которых на события не нашло достаточного отражения в письменных источниках из-за дискриминации со стороны белой протестантской элиты. Основной аргумент сторонников «исправления истории» состоит в том, что если генеративные модели ИИ будут и дальше воспроизводить предвзятости прошлых эпох, общественный прогресс не просто замедлится, а повернется вспять. Во имя лучшего будущего надо контролировать содержание обучающих датасетов ИИ и не допускать туда аморальные по современным американским меркам материалы без осуждающих комментариев[30].
Конечно же, при всей благонамеренности таких усилий, они не могли не вызвать встречную реакцию, причем в основном не со стороны ученых-историков, отстаивающих неприкосновенность источников, а со стороны тех, кто не отрицал необходимости контроля, но имел иные представления о том, что из прошлого следует сохранить, а что позабыть как можно скорее. Современные идейные и политические баталии в США между трампистами и их либеральными противниками помещают профессиональных историков как бы между молотом и наковальней: в разгар сражений войн памяти отстаивать умеренную позицию без прямого высказывания симпатий к одной из сторон становится просто опасно, если (пока) не для жизни, то для профессиональной карьеры. Распространение ИИ в определенном смысле подлило масла в огонь идейных споров в США, так как все вовлеченные в эти споры осознают важность влияния, которое может иметь та или иная траектория развития ИИ на американское общество и политику.
Заключение
Освоение американскими историками технологий искусственного интеллекта шло в последние годы достаточно интенсивно, хотя достигнутые результаты пока не могут сравниться по «вау-эффекту» с результатами американских инженеров и компьютерщиков. Традиционным преимуществом историков в США всегда был доступ к значительным по объему источникам финансирования и к технической поддержке, что позволило им запустить и реализовать множество амбициозных проектов, о которых их российские коллеги могут по большей части только мечтать. Вместе с тем революции в исторической науке не произошло, и она не просматривается даже на горизонте: как и раньше, общественно значимое и глубокое осмысление прошлого способны предложить только ученые, нейросети же могут либо генерировать обобщающие тексты разной степени достоверности, либо работать «на подхвате» в качестве очень расторопных и квалифицированных ассистентов для решения разного рода частных задач.
Самая полезная функция ИИ для историков — способность обрабатывать огромные массивы письменных и визуальных источников. С этими массивами теперь можно буквально разговаривать, на обычном естественном языке. Однако это пока не доступно без предварительной подготовки: универсальные модели не обеспечивают поиска только в интересующем исследователя наборе документов; даже при прямом требовании не делать этого все равно неизбежно используют другие данные, на которых обучены, либо просто фантазируют. Для полноценной научной работы необходимы локальные модели, использующие только специально отобранные источники и обученные для решения строго определенных задач. Создание и настройка таких моделей, подготовка наборов данных для их обучения из массивов традиционных рукописных и печатных материалов — все это требует денег и технической экспертизы. И самое главное, требует понимания того, какие вопросы мы действительно хотим задать прошлому, и готовности принять ответ, каким бы неудобным и неожиданным он ни оказался.
Опасения, связанные с распространением ИИ в области истории, по большей степени связаны не с наукой, а с историческим образованием. Уже формирующаяся привычка получать знания о прошлом с помощью ближайшей доступной нейросети, действительно, довольно пагубна и деструктивна. Таким образом общество может окончательно переселиться в мир фантазий, причем непонятно кем и как формируемых (если учитывать, что даже создатели ИИ не в состоянии в достаточной степени его контролировать). Хорошая новость заключается в том, что такая ситуация только повысит ценность книг, написанных профессиональными историками. Однако умение использовать потенциал ИИ при этом обязательно должно стать частью их профессиональной подготовки.
- FromThePage. [Электронный ресурс]. URL: https://fromthepage.com/landing (дата обращения: 17.05.2025). ↩
- Humphries M., et al. Unlocking the Archives: Using Large Language Models to Transcribe Handwritten Historical Documents. 02.11.2024. [Электронный ресурс]. URL: http://arxiv.org/abs/2411.03340 (дата обращения: 17.05.2025). ↩
- Russian Generic Handwriting 2 // READ-COОР. [Электронный ресурс]. URL: https://readcoop.eu/model/russian-generic-handwriting/ (дата обращения: 17.05.2025). ↩
- Яндекс Поиск по архивам. [Электронный ресурс]. URL: https://yandex.ru/archive (дата обращения: 17.05.2025). ↩
- Nelson D. First Forays into Rev City and Automatic Transcription. 02.12.2024. [Электронный ресурс]. URL: https://www.amphilsoc.org/news/first-forays-rev-city-and-automatic-transcription (дата обращения: 17.05.2025). ↩
- eScripta — Digital Tools and Techniques for the Study of Ancient Writing. 18.03.2019. [Электронный ресурс]. URL: https://escripta.hypotheses.org/ (дата обращения: 17.05.2025). ↩
- Breen B. How to Use Generative AI for Historical Research // Res Obscura. 14.11.2023. [Электронный реcypc]. URL: https://resobscura.substack.com/p/generative-ai-for-historical-research (дата обращения: 18.05.2025). ↩
- Chronicling America // Library of Congress, Washington (D.C.). [Электронный pecypc]. URL: https://www.loc.gov/collections/chronicling-america/about-this-collection/ (дата обращения: 18.05.2025). ↩
- Newspaper Navigator | Experiments // Library of Congress, Washington (D.C.). [Электронный ресурс]. URL: https://labs.loc.gov/work/experiments/newspaper-navigator/ (дата обращения: 18.05.2025). ↩
- В марте 2025 г. президент США Трамп подписал указ о сокращении семи федеральных агентств, включая Институт музейных и библиотечных служб (IMLS), основной источник финансирования для библиотек и музеев по всей стране. (См.: Vilcarino J. Trump Admin. Cuts Library Funding. What It Means for Students // Education Week. 19.03.2025. [Электронный ресурс]. URL: https://www.edweek.org/policy-politics/trump-admin-cuts-library-funding-what-it-means-for-students/2025/03 (дата обращения: 18.05.2025)). ↩
- Waxman O.B. How Artificial Intelligence Is Helping Identify Thousands of Unknown Civil War Soldiers // TIME. 19.12.2019. [Электронный ресурс]. URL: https://numberstonames.org/ (дата обращения: 18.05.2025). Страница проекта: https://www.civilwarphotosleuth.com/ ↩
- From Numbers to Names. [Электронный ресурс]. URL: https://numberstonames.org/ (дата обращения: 18.05.2025). ↩
- Ginosar S., et al. A Century of Portraits: A Visual Historical Record of American High School Yearbooks. 12.06.2019. [Электронный ресурс]. URL: http://arxiv.org/abs/1511.02575 (дата обращения: 18.05.2025). ↩
- Promoting the Use of Trustworthy Artificial Intelligence in the Federal Government // Federal Register. 08.12.2020. [Электронный ресурс]. URL: https://www.federalregister.gov/documents/2020/12/08/2020-27065/promoting-the-use-of-trustworthy-artificial-intelligence-in-the-federal-government (дата обращения: 18.05.2025). ↩
- Inventory of NARA Artificial Intelligence (AI) Use Cases // National Archives. 06.09.2024. [Электронный ресурс]. URL: https://www.archives.gov/ai (дата обращения: 18.05.2025). ↩
- Цветкова Н.А. Тридцать лет после открытия архивов: критический обзор истории и историографии «идеологической “холодной войны”» // Американский ежегодник 2021. M., 2021. C. 314. DOI:10.32608/1010-5557-2021-2021-314-336 ↩
- About SNAC | SNAC Cooperative. [Электронный ресурс]. URL: https://portal.snaccooperative.org/about (дата обращения: 18.05.2025). В Европе реализуется похожий по замысле проект: The Time Machine. [Электронный ресурс]. URL: https://cordis.europa.eu/project/id/820323 (дата обращения: 18.05.2025). ↩
- Social Networks and Archival Context. [Электронный реcypc]. URL: https://snac-web.iath.virginia.edu/ (дата обращения: 18.05.2025). ↩
- Machines Reading Maps. [Электронный ресурс]. URL: https://machines-reading-maps.github.io/ (дата обращения: 20.05.2025). ↩
- Uhl J. H., Leyk S. MTBF-33: A Multi-Temporal Building Footprint Dataset for 33 Counties in the United States (1900–2015) // Data in Brief. T. 43. C. 108369. DOI: 10.1016/j.dib.2022.108369 ↩
- Experiment: AI assisted open mapping // Humanitarian OpenStreetMap Team. 16.12.2021. [Электронный ресурс]. URL: https://www.hotosm.org/tech-blog/experiment-ai-assisted-open-mapping/ (дата обращения: 20.05.2025). ↩
- В сети уже существуют довольно удобные коллекции старых карт (например, применительно к России, http://www.etomesto.ru/), но ИИ-технологии позволили бы перевести их в более удобный векторный формат и сделать глобальными по пространственному и хронологическому охвату. ↩
- Tavakkol S., et al. Kartta Labs: Collaborative Time Travel. 07.10.2020. [Электронный ресурс]. URL: http://arxiv.org/abs/2010.06536 (дата обращения: 20.05.2025). ↩
- Hello History – Chat with AI Generated Historical Figures. [Электронный ресурс]. URL: https://www.hellohistory.ai/ (дата обращения: 20.05.2025). ↩
- History Lab. [Электронный ресурс]. URL: https://historylab.squarespace.com (дата обращения: 20.05.2025). ↩
- Postrel V. The Future of AI is Helping Us Discover the Past // Reason.com. 05.05.2024. [Электронный ресурс]. URL: https://reason.com/2024/05/05/the-future-of-ai-is-helping-us-discover-the-past/ (дата обращения: 20.05.2025). ↩
- Meadows D., Sternfeld J. AI and History // History in Focus Podcast. 04.10.2023. [Электронный ресурс]. URL: https://www.historians.org/podcast/ai-and-history-arms-and-american-revolutions/ (дата обращения: 10.05.2025). ↩
- Многие из охарактеризованных в статье проектов реализованы с помощью собственных ИИ-моделей, код которых выложен в открытый доступ. Когда авторы публикуют также и использованные датасеты (как, например, это было сделано в упомянутом выше проекте «Newspaper Navigator», см. выше), принцип репликативности можно считать соблюденным. ↩
- Зашихина И.М. Научные публикации и большие языковые модели: поймет ли нейросеть российскую науку? // Научный редактор и издатель. 2024. Т. 9. № 1. С. 40. URL: https://doi.org/10.24069/SEP-24-11 ↩
- Ferrer X. Bias and Discrimination in AI: A Cross-Disciplinary Perspective // IEEE Technology and Society. 07.08.2021. [Электронный ресуpc]. URL: http://technologyandsociety.org/bias-and-discrimination-in-ai-a-cross-disciplinary-perspective/ (дата обращения: 24.05.2025). ↩