Мультимодальные модели: как GPT-4o и Gemini научились слышать, видеть и понимать

Ещё недавно нейросети работали как ремесленники-одиночки: одна писала тексты, вторая рисовала, третья расшифровывала голос. Мультимодальные модели — системы, которые одновременно принимают и порождают текст, звук, изображения и видео — стёрли эти границы. GPT-4o от OpenAI и Gemini от Google стали самыми громкими примерами такого подхода, а вокруг них успела вырасти гора мифов. Разберёмся, что реально происходит «под капотом», когда нейросеть смотрит видео или слушает собеседника.

Что такое мультимодальность простыми словами

Мультимодальность — это способность одной модели работать с данными разных типов в едином цикле. Человек ведь тоже никогда не воспринимает речь в чистом виде: он слышит интонацию, видит жест, читает выражение лица — и только так улавливает полный смысл. Ранние голосовые ассистенты шли цепочкой: сначала распознавание речи, затем текстовая модель, потом синтез голоса. На каждом стыке терялись детали — паузы, вздохи, сарказм.

Новая архитектура убрала посредников. Внутри GPT-4o звук не превращается в текст, а сразу нарезается на аудиотокены — условные «кубики» звука, с которыми сеть обращается так же, как со словами. Эмбеддинг (числовой вектор, кодирующий смысл фрагмента) у слова «мягко» и у соответствующей интонации в голосе попадает в общее пространство смыслов. Поэтому модель улавливает, что собеседник шутит, а не просто читает расшифровку его реплики.

Текст и картинки: общее пространство смыслов

С изображениями механика похожая. Картинка режется на фрагменты-патчи, каждый превращается в вектор — и дальше нейросеть анализирует изображения уже не как «фотографию», а как последовательность смысловых единиц. На вопрос «что смешного на этом фото» она отвечает с опорой на контекст: соотносит детали, композицию, мемы и отсылки, а не перечисляет объекты по списку.

Gemini изначально обучалась на смеси модальностей, GPT-4o пришёл к этому через несколько итераций. На практике разница проявляется в деталях. У Gemini шире контекстное окно — объём данных, который модель удерживает «в голове» за один запрос, — что позволяет скармливать ей сотни страниц и многочасовые записи. GPT-4o берёт скоростью реакции и живостью диалога.

Звук: почему голосовой режим отвечает за секунды

Главный прорыв GPT-4o — сквозная (end-to-end) обработка речи, когда путь от «уха» до «рта» идёт без промежуточных расшифровок. Классический стек «распознавание → текст → ответ → озвучка» тратил несколько секунд и убивал живость разговора. Здесь речь генерируется токен за токеном, и средняя задержка сопоставима с человеческой.

Что это даёт пользователю:

  • собеседника можно перебивать — модель слышит контекст и не «зависает»;
  • интонация и темп подстраиваются под задачу: сказку читают медленно, инструкцию — бодро;
  • шёпот, акцент, фоновый шум — смысл вытягивается даже из неидеального звука;
  • перевод с голоса на голос сохраняет эмоции говорящего.

Gemini отвечает симметрично: голосовой режим в приложении и функции вроде Gemini Live делают ставку на потоковую обработку звука в реальном времени. Камера телефона превращается в «глаза» ассистента — наводишь объектив на незнакомый прибор и вслух спрашиваешь, что с ним делать.

Видео: нейросеть смотрит ролик и отвечает на вопросы

Для модели видео — это поток кадров плюс звуковая дорожка. Gemini уверенно берёт длинные записи: лекцию, трансляцию матча, подкаст. Можно спросить, что происходило на седьмой минуте, попросить найти момент, где спикер показал график, или пересказать сюжет. GPT-4o работает с видео через отдельные кадры — это ограничивает длину, зато даёт высокую точность на коротких роликах: разбор ошибки в спортивной технике, поиск конкретного кадра, описание сцены.

Тонкий момент: сеть не «понимает» видео как человек. Непрерывное движение — территория классического компьютерного зрения; языковая модель скорее сопоставляет ключевые кадры и восстанавливает хронологию событий. Для большинства задач этого достаточно, но быструю смену планов или тонкую хореографию она может упустить.

Сравнение GPT-4o и Gemini глазами практика

Прямое сравнение GPT-4o и Gemini упирается в конкретные задачи. Отраслевая практика складывается примерно так:

  1. Живой голосовой диалог — у GPT-4o быстрее реакция и естественнее паузы.
  2. Длинные документы и часы видео — преимущество Gemini за счёт объёма контекста.
  3. Изображения — обе читают графики, схемы и рукописный текст; результат зависит от версии и языка.
  4. Русская речь — понимание уверенное, но интонации синтеза пока звучат «переводными».

Где мультимодальный ИИ уже приносит пользу

Технология давно вышла из демо-роликов. Ученик фотографирует задачу и получает разбор каждого шага. Врач проговаривает наблюдения голосом — модель структурирует их в карту приёма. Службы поддержки анализируют звонки не по расшифровке, а по интонации, ловя раздражение клиента до того, как он перейдёт на крик. Разработчик показывает скриншот интерфейса и просит собрать прототип. А система, следящая за видеопотоком с производства, замечает дым раньше датчиков.

Цена вопроса и подводные камни

Обработка звука и видео требует в разы больше вычислений, чем текст, поэтому такие запросы ощутимо дороже — эксперты по машинному обучению советуют трезво считать экономику до перевода бизнес-процессов на «мультимодальные рельсы». Добавим сюда приватность: когда ассистент постоянно слушает и смотрит, граница между помощью и наблюдением становится тонкой. И всё же направление задано — интерфейс всё ближе к разговору с собеседником, у которого идеальная память, мгновенная реакция и ни секунды раздражения.

Оцените статью