Камо грядеши, искусственный интеллект?

Современному общедоступному искусственному интеллекту (ИИ, AI) чуть более трёх лет, хотя кажется, что он с нами уже очень давно. Если 2023 год стал годом шока и восторга от первого общения с появившимися чат-ботами с ИИ, то в 2026-м ИИ перестал быть чем-то особенным и сверхъестественным. Он покончил с ролью игрушки и перешёл в категорию широко используемого инструмента, части повседневности. Происходящее с ним сейчас напоминает авиацию в 1920-е годы: уже есть летающие машины, которые никого не удивляют, — они воюют, перевозят почту, грузы и пассажиров, а некоторые одиночки даже пересекают на них Атлантический океан, — но до реактивной эры и массовых пассажирских перевозок ещё далеко. Однако за свою недолгую историю ИИ успел наделать много шума: кого-то вдохновил, а кого-то напугал, приобрёл сторонников и противников. Появляются как утопические высказывания: «ИИ решит все проблемы человечества», так и антиутопии: «ИИ уничтожит человечество». В этой статье я с позиции оптимиста проанализирую, куда сейчас идёт ИИ, каковы современные тенденции и направления развития его технологий.
Немного об истоках
Несмотря на то, что работам по созданию ИИ уже три четверти века, эра современного ИИ началась совсем недавно, в 2012 году, когда, по сути, было изобретено глубокое обучение искусственных нейронных сетей. После этого события стали развиваться лавинообразно, разрастаясь, словно снежный ком. Началось широкое внедрение технологий ИИ.
Современные чат-боты с ИИ стали разрабатывать уже с 2016 года, но прорыв произошёл, когда исследовательское подразделение компании Google — Google Brain (входило в состав Google Research) в 2017 году представило архитектуру глубоких нейросетей, получившую название «трансформер», которая легла в основу больших языковых моделей (LLM). Не менее революционную роль в их создании сыграло изобретение в 2018 году предобучения трансформеров, приведшее в том же году к созданию компанией OpenAI первой модели GPT (Generative Pre-trained Transformer — генеративный предобученный трансформер).
Годом же рождения ИИ в его современной форме может считаться 2020 год, когда OpenAI выпустила третье поколение системы обработки естественного языка на основе большой языковой модели — GPT-3, которая впервые по-настоящему продемонстрировала человекоподобные черты. Основанный на ней ChatGPT, запущенный 30 ноября 2022 года, мгновенно приобрёл статус глобального феномена. С этого момента ИИ стал доступен широкой аудитории, что оказалось важным этапом в его развитии. Данный ИИ был обучен на огромных объёмах текстов и мог общаться с пользователями «по-человечески», отвечая на вопросы по широкому кругу тем в текстовом виде.
ChatGPT спустил лавину, и уже в 2023 году в массовый доступ ворвались сразу несколько генеративных ИИ, способных понимать контекст и писать тексты в ответ на запросы. Свои чат-боты выпустили компании Google (Bard, быстро переименованный в Gemini), Яндекс (YandexGPT, затем Alice AI, внедрён также в интеллектуальный помощник «Алиса»), Anthropic (Claude) и Сбер (GigaChat). К слову, видимо, именно их общий ошеломляющий успех привёл к присуждению Нобелевской премии за 2024 год основоположникам глубокого обучения*. Справедливости ради отметим, что генеративный ИИ Gato от компании DeepMind появился чуть раньше, в мае 2022 года, но он никогда не был общедоступным.
Одновременно шло развитие мультимодальности ИИ. В данном контексте модальности — это формы представления или типы получаемой информации. Их можно назвать различными «органами чувств» нейросети, которые позволяют ей воспринимать мир. К основным модальностям относят: текст (слова, символы, код), изображения (фотографии, картинки, схемы, чертежи), аудио (речь, музыка, шумы), видео, сенсорные данные (показания датчиков).
Изначально каждая модальность обрабатывалась отдельными, слабо связанными нейросетями. К слову, первые чат-боты были текстовыми. Но в 2020 году исследователи всё той же Google Brain разработали ViT (Vision Transformer), показав, что изображения можно обрабатывать тем же трансформером, что и текст. Это открыло путь к единой архитектуре, и уже в 2021 году ИИ трудами компании OpenAI сначала научился предсказывать, какой текст соответствует какому изображению (CLIP), а затем и генерировать изображения по тексту (DALL-E). Успех следовал за успехом, и к 2023 году произошёл прорыв в работе одновременно с несколькими модальностями, породивший взрыв генеративных возможностей ИИ.
Это позволило в 2023—2024 годах совершить качественный скачок и перейти к так называемой нативной мультимодальности. Под этим подразумевается способность ИИ обрабатывать и понимать разные типы данных (текст, изображения, звук, видео) одновременно и без перевода в текст, подобно тому, как это делают люди. В этом случае нейросеть «с рождения» обучается на смешанных данных, формируя единое, неразрывное представление мира. Отсюда и слово «нативный» (от английского native), означающее «врождённый».
Чтобы понять сказанное и оценить важность сделанного, рассмотрим простой пример. Раньше, чтобы ИИ «понял» видео, работал целый конвейер: видео разбивалось на кадры, которые затем превращались в текст, он анализировался и только после этого ИИ выдавал ответ. Совершенно очевидно, что при таком подходе много информации терялось при переводе в текст. Представьте себе, что при просмотре фильма вы сидите с закрытыми глазами, а находящийся рядом друг пересказывает вам, что происходит на экране…
При нативном подходе пиксели изображения и звук напрямую поступают в нейросеть, которая сама выделяет важное, «понимая» происходящее без посредников, начиная с физики, кончая интонациями и визуальным контекстом. Например, она, подобно человеку, «поймёт», что мяч на экране катится не потому, что прочитала описание вроде «мяч круглый и перемещается», а потому что увидела пиксели и перед этим вывела законы движения из миллионов просмотренных видео. Первыми полностью нативными мультимодальными моделями стали GPT-4V (2023) и Gemini (2024), которые с самого начала обучались на смеси текста, изображений, аудио и видео.
Новая парадигма
В настоящее время популярна классификация, выделяющая три уровня зрелости технологий ИИ: Conventional AI, AI-First и AI-Native.
Первый уровень — Conventional AI («обычный ИИ») соответствует применению ИИ как отдельных надстроек или функций для автоматизации рутинных задач, повышения производительности и сокращения издержек. ИИ служит просто одним из инструментов решения поставленных задач. В целом все процессы и решения остаются прежними.
Второй уровень — AI-First («ИИ в приоритете») — это уже стратегический поворот к технологической интеграции. При этом архитектура систем и процессов перестраивается так, чтобы принимать решения на основе ИИ (машинного обучения и данных), но человек всё ещё выступает главным оператором процессов.
И, наконец, третий уровень — AI-Native («врождённый ИИ») — это высшая ступень зрелости, когда все процессы и продукты проектируются с нуля специально под возможности ИИ. Здесь ИИ уже не надстройка, а фундамент. Он способен рассуждать, планировать и действовать автономно без постоянных указаний человека. Упор делается на автоматизацию процессов с минимальным человеческим участием.
Это похоже на то, как происходила эволюция автомобилей. Первые самодвижущиеся экипажи конца XVIII — начала XIX века выглядели как обычные кареты, к которым приделали паровой котёл. Изобретатели того времени мыслили категорией «добавим движитель к тому, что уже есть». Потребовались десятилетия, чтобы появились бензиновый и дизельный двигатели и конструкция автомобиля стала приспосабливаться к их использованию. И ещё достаточно много времени, пока у современных машин не появился кузов и всё прочее, специально спроектированное вокруг двигателя, а теперь ещё и автопилот.
На каком этапе мы находимся сейчас, в 2026 году? Ответ неоднозначен, поскольку текущая фаза развития крайне неравномерна среди организаций. Как сказали бы в подобной ситуации экономисты: экономика многоукладна. Однако, по мнению экспертов, можно утверждать, что стандартом для лидеров уже стал AI-First (к продуктам такого уровня можно отнести, например, автопилоты и современные поисковые системы). А на переднем крае инноваций даже появляются ростки AI-Native.
Современное развитие ИИ уже позволяет рассматривать его в качестве полноценного партнёра, а не просто как обычный инструмент, пусть и продвинутый. Можно даже с определённой натяжкой сказать — мыслящего партнёра, общение с которым меняет методы учёбы, работы и творчества. Одним из первых к такому выводу пришёл профессор Уортонской школы бизнеса при Пенсильванском университете (к слову, одна из самых престижных бизнес-школ в мире) Итан Моллик, признанный специалист по внедрению ИИ в повседневную жизнь, бизнес и образование. Ещё в 2024 году он опубликовал книгу «Совместный интеллект. Жизнь и работа с ИИ» (Co-Intelligence: Living and Working with AI), которая стала одним из самых авторитетных и цитируемых практических путеводителей по внедрению ИИ. Моллик даже был назван журналом Time одним из самых влиятельных людей в области ИИ 2024 года.
Каковы же основные направления эволюции технологий ИИ в 2026 году?

Из собеседника — в партнёры
Главный тренд нашего времени — переход от чат-ботов к ИИ-агентам, начавшийся в 2025 году. Ключевое отличие ИИ-агента от традиционного чат-бота — высокий уровень самостоятельности. Обычный чат-бот работает в режиме «вопрос-ответ». Человек задаёт вопрос — бот отвечает либо текстом, либо голосом. Агент же не просто отвечает на вопрос, а может сам искать информацию, анализировать данные и выстраивать последовательность действий без постоянного контроля человека. В частности, агент способен написать код, текст или картину, решить задачу. Это принципиальный переход от синхронного взаимодействия к асинхронному, многошаговому, автономному.
Агенты работают на основе больших языковых моделей (LLM), но с критически важной надстройкой — способностью к долгосрочному планированию и использованию инструментов. Раньше модель «думала» токенами (словами, их частями или даже отдельными символами), теперь она «думает» ещё и «шагами». Это называется цепочкой мыслей (Chain-of-Thought). Кстати, GPT-5 и Gemini, начиная с версии 2.0 (декабрь 2024), ориентированы на работу в составе агентов.
В настоящее время агенты научились разбивать абстрактную цель на древовидную структуру подзадач. Это похоже на шахматы: мозг гроссмейстера просчитывает не просто следующий ход, а дерево вариантов на 10 шагов вперёд, постоянно отсекая слабые ветви («стрижка дерева»). Так и агент: столкнувшись с ошибкой (например сайт для бронирования не грузится), он не выдаёт «извините, ошибка», а сам ищет обходной путь, скажем, зеркало этого сайта или сайт другой организации. Агенты учатся работать с интерфейсами взаимодействия программ (API, application programming interface) и заполнять формы. OpenAI, Anthropic и Google активно развивают технологию «Computer Use» — способность ИИ управлять обычным браузером и приложениями с помощью мыши и клавиатуры, подобно человеку. При этом ИИ «видит» экран по скриншотам, распознаёт интерфейс и выполняет клики, скроллинг и ввод текста.
Модели ИИ 2025—2026 годов уже обладают долговременной памятью и способны помнить контекст не в пределах одного диалога, а в течение длительного времени. В частности, ИИ-помощник в ходе продолжительного общения узнаёт ваши предпочтения и привычки.
И совсем скоро вы сможете сказать ИИ-агенту: «Разберись с моей почтой», и он начнёт автоматическую обработку сообщений в соответствии с настройками. Например:
- Прочитает входящие сообщения, удаляя спам и сортируя письма по папкам «Срочно», «Работа», «Подписки» и т. п.
- Выделит суть длинных писем и сформирует краткую выжимку.
- Проанализирует текст письма, а затем предложит готовые варианты ответов, а, возможно, на некоторые ответит и сам вместо вас.
- Обнаружив, скажем, письма из налоговой, агент определит, что от вас требуется. Найдёт в вашем облачном хранилище нужные квитанции, скомпонует ответ, приложив документы, и отправит.
- Поставит в календарь напоминание о сроке уплаты и спросит: «Оплатить сейчас с вашего счёта?».
И так далее.
Кстати, это уже не фантастика. В январе 2026 года Google объявил о крупном обновлении почтовой службы Gmail с более глубокой интеграцией ИИ Gemini. При этом в Gmail появится новая функция AI Inbox, которая возьмёт на себя сортировку и группировку почты по темам. Пока она ещё не будет платить за вас налоги, но даст краткие сводки по непрочитанным письмам, укажет, что требует срочного внимания, и составит список задач, где могут быть напоминания ответить на конкретное письмо, оплатить счёт или сделать что-нибудь ещё, что агент сочтёт важным. Причём его работа основана не только на содержании писем, но и на привычках пользователя. Например, AI Inbox будет учитывать, какие сообщения пользователь считает важными, на какие реагирует сразу, а что откладывает. Функция с апреля 2026 года стала доступна пока только для пользователей из США, да и подписка на неё дороговата — $250. Впрочем, Google обнадёживает, что в будущем ситуация изменится.

Старается не отстать и отечественная Яндекс Почта, которая в 2026 году внедрила чат с Алисой Про — ИИ-ассистентом, который помогает с решением рабочих и личных задач. Он умеет извлекать из писем факты, обобщать данные и готов ответить на самые разные вопросы по содержимому ящика. Алиса Про не просто находит письмо или цепочку писем с нужными сведениями, а даёт готовый ответ с фактами прямо в чате. При этом она работает как с текстами писем, так и с вложениями: PDF-файлами, документами, таблицами, презентациями. В основе Алисы Про лежит генеративная модель Alice AI LLM, поэтому она умеет искать не по словам, а по смыслу. Например, у неё можно спросить: «Сколько я заплатил за квартиру в феврале?». Для составления ответов и писем по вводным от пользователя используется RAG-система, задача которой объединять знания о мире, которые накопила Alice AI LLM, и факты, извлечённые из писем. Чат с Алисой Про пока доступен только тем, кто подключил тариф «Яндекс 360».
