Камо грядеши, искусственный интеллект?

Кандидат физико-математических наук Алексей Понятов

Современному общедоступному искусственному интеллекту (ИИ, AI) чуть более трёх лет, хотя кажется, что он с нами уже очень давно.

Современному общедоступному искусственному интеллекту (ИИ, AI) чуть более трёх лет, хотя кажется, что он с нами уже очень давно. Если 2023 год стал годом шока и восторга от первого общения с появившимися чат-ботами с ИИ, то в 2026-м ИИ перестал быть чем-то особенным и сверхъестественным. Он покончил с ролью игрушки и перешёл в категорию широко используемого инструмента, части повседневности. Происходящее с ним сейчас напоминает авиацию в 1920-е годы: уже есть летающие машины, которые никого не удивляют, — они воюют, перевозят почту, грузы и пассажиров, а некоторые одиночки даже пересекают на них Атлантический океан, — но до реактивной эры и массовых пассажирских перевозок ещё далеко. Однако за свою недолгую историю ИИ успел наделать много шума: кого-то вдохновил, а кого-то напугал, приобрёл сторонников и противников. Появляются как утопические высказывания: «ИИ решит все проблемы человечества», так и антиутопии: «ИИ уничтожит человечество». В этой статье я с позиции оптимиста проанализирую, куда сейчас идёт ИИ, каковы современные тенденции и направления развития его технологий.

При создании иллюстраций использовался чат-бот GigaChat на основе ИИ на базе LML.
Наука и жизнь // Иллюстрации

Немного об истоках

Несмотря на то, что работам по созданию ИИ уже три четверти века, эра современного ИИ началась совсем недавно, в 2012 году, когда, по сути, было изобретено глубокое обучение искусственных нейронных сетей. После этого события стали развиваться лавинообразно, разрастаясь, словно снежный ком. Началось широкое внедрение технологий ИИ.

Современные чат-боты с ИИ стали разрабатывать уже с 2016 года, но прорыв произошёл, когда исследовательское подразделение компании Google — Google Brain (входило в состав Google Research) в 2017 году представило архитектуру глубоких нейросетей, получившую название «трансформер», которая легла в основу больших языковых моделей (LLM). Не менее революционную роль в их создании сыграло изобретение в 2018 году предобучения трансформеров, приведшее в том же году к созданию компанией OpenAI первой модели GPT (Generative Pre-trained Transformer — генеративный предобученный трансформер).

Годом же рождения ИИ в его современной форме может считаться 2020 год, когда OpenAI выпустила третье поколение системы обработки естественного языка на основе большой языковой модели — GPT-3, которая впервые по-настоящему продемонстрировала человекоподобные черты. Основанный на ней ChatGPT, запущенный 30 ноября 2022 года, мгновенно приобрёл статус глобального феномена. С этого момента ИИ стал доступен широкой аудитории, что оказалось важным этапом в его развитии. Данный ИИ был обучен на огромных объёмах текстов и мог общаться с пользователями «по-человечески», отвечая на вопросы по широкому кругу тем в текстовом виде.

ChatGPT спустил лавину, и уже в 2023 году в массовый доступ ворвались сразу несколько генеративных ИИ, способных понимать контекст и писать тексты в ответ на запросы. Свои чат-боты выпустили компании Google (Bard, быстро переименованный в Gemini), Яндекс (YandexGPT, затем Alice AI, внедрён также в интеллектуальный помощник «Алиса»), Anthropic (Claude) и Сбер (GigaChat). К слову, видимо, именно их общий ошеломляющий успех привёл к присуждению Нобелевской премии за 2024 год основоположникам глубокого обучения. Справедливости ради отметим, что генеративный ИИ Gato от компании DeepMind появился чуть раньше, в мае 2022 года, но он никогда не был общедоступным.

Одновременно шло развитие мультимодальности ИИ. В данном контексте модальности — это формы представления или типы получаемой информации. Их можно назвать различными «органами чувств» нейросети, которые позволяют ей воспринимать мир. К основным модальностям относят: текст (слова, символы, код), изображения (фотографии, картинки, схемы, чертежи), аудио (речь, музыка, шумы), видео, сенсорные данные (показания датчиков).

Изначально каждая модальность обрабатывалась отдельными, слабо связанными нейросетями. К слову, первые чат-боты были текстовыми. Но в 2020 году исследователи всё той же Google Brain разработали ViT (Vision Transformer), показав, что изображения можно обрабатывать тем же трансформером, что и текст. Это открыло путь к единой архитектуре, и уже в 2021 году ИИ трудами компании OpenAI сначала научился предсказывать, какой текст соответствует какому изображению (CLIP), а затем и генерировать изображения по тексту (DALL-E). Успех следовал за успехом, и к 2023 году произошёл прорыв в работе одновременно с несколькими модальностями, породивший взрыв генеративных возможностей ИИ...

 

Продолжение статьи читайте в номере журнала

Портал журнала «Наука и жизнь» использует файлы cookie и рекомендательные технологии. Продолжая пользоваться порталом, вы соглашаетесь с хранением и использованием порталом и партнёрскими сайтами файлов cookie и рекомендательных технологий на вашем устройстве. Подробнее

Товар добавлен в корзину

Оформить заказ

или продолжить покупки