Ещё недавно нейросети работали как ремесленники-одиночки: одна писала тексты, вторая рисовала, третья расшифровывала голос. Мультимодальные модели — системы, которые одновременно принимают и порождают текст, звук, изображения и видео — стёрли эти границы. GPT-4o от OpenAI и Gemini от Google стали самыми громкими примерами такого подхода, а вокруг них успела вырасти гора мифов. Разберёмся, что реально происходит «под капотом», когда нейросеть смотрит видео или слушает собеседника.
Что такое мультимодальность простыми словами
Мультимодальность — это способность одной модели работать с данными разных типов в едином цикле. Человек ведь тоже никогда не воспринимает речь в чистом виде: он слышит интонацию, видит жест, читает выражение лица — и только так улавливает полный смысл. Ранние голосовые ассистенты шли цепочкой: сначала распознавание речи, затем текстовая модель, потом синтез голоса. На каждом стыке терялись детали — паузы, вздохи, сарказм.
Новая архитектура убрала посредников. Внутри GPT-4o звук не превращается в текст, а сразу нарезается на аудиотокены — условные «кубики» звука, с которыми сеть обращается так же, как со словами. Эмбеддинг (числовой вектор, кодирующий смысл фрагмента) у слова «мягко» и у соответствующей интонации в голосе попадает в общее пространство смыслов. Поэтому модель улавливает, что собеседник шутит, а не просто читает расшифровку его реплики.
Текст и картинки: общее пространство смыслов
С изображениями механика похожая. Картинка режется на фрагменты-патчи, каждый превращается в вектор — и дальше нейросеть анализирует изображения уже не как «фотографию», а как последовательность смысловых единиц. На вопрос «что смешного на этом фото» она отвечает с опорой на контекст: соотносит детали, композицию, мемы и отсылки, а не перечисляет объекты по списку.
Gemini изначально обучалась на смеси модальностей, GPT-4o пришёл к этому через несколько итераций. На практике разница проявляется в деталях. У Gemini шире контекстное окно — объём данных, который модель удерживает «в голове» за один запрос, — что позволяет скармливать ей сотни страниц и многочасовые записи. GPT-4o берёт скоростью реакции и живостью диалога.
Звук: почему голосовой режим отвечает за секунды
Главный прорыв GPT-4o — сквозная (end-to-end) обработка речи, когда путь от «уха» до «рта» идёт без промежуточных расшифровок. Классический стек «распознавание → текст → ответ → озвучка» тратил несколько секунд и убивал живость разговора. Здесь речь генерируется токен за токеном, и средняя задержка сопоставима с человеческой.
Что это даёт пользователю:
- собеседника можно перебивать — модель слышит контекст и не «зависает»;
- интонация и темп подстраиваются под задачу: сказку читают медленно, инструкцию — бодро;
- шёпот, акцент, фоновый шум — смысл вытягивается даже из неидеального звука;
- перевод с голоса на голос сохраняет эмоции говорящего.
Gemini отвечает симметрично: голосовой режим в приложении и функции вроде Gemini Live делают ставку на потоковую обработку звука в реальном времени. Камера телефона превращается в «глаза» ассистента — наводишь объектив на незнакомый прибор и вслух спрашиваешь, что с ним делать.
Видео: нейросеть смотрит ролик и отвечает на вопросы
Для модели видео — это поток кадров плюс звуковая дорожка. Gemini уверенно берёт длинные записи: лекцию, трансляцию матча, подкаст. Можно спросить, что происходило на седьмой минуте, попросить найти момент, где спикер показал график, или пересказать сюжет. GPT-4o работает с видео через отдельные кадры — это ограничивает длину, зато даёт высокую точность на коротких роликах: разбор ошибки в спортивной технике, поиск конкретного кадра, описание сцены.
Тонкий момент: сеть не «понимает» видео как человек. Непрерывное движение — территория классического компьютерного зрения; языковая модель скорее сопоставляет ключевые кадры и восстанавливает хронологию событий. Для большинства задач этого достаточно, но быструю смену планов или тонкую хореографию она может упустить.
Сравнение GPT-4o и Gemini глазами практика
Прямое сравнение GPT-4o и Gemini упирается в конкретные задачи. Отраслевая практика складывается примерно так:
- Живой голосовой диалог — у GPT-4o быстрее реакция и естественнее паузы.
- Длинные документы и часы видео — преимущество Gemini за счёт объёма контекста.
- Изображения — обе читают графики, схемы и рукописный текст; результат зависит от версии и языка.
- Русская речь — понимание уверенное, но интонации синтеза пока звучат «переводными».
Где мультимодальный ИИ уже приносит пользу
Технология давно вышла из демо-роликов. Ученик фотографирует задачу и получает разбор каждого шага. Врач проговаривает наблюдения голосом — модель структурирует их в карту приёма. Службы поддержки анализируют звонки не по расшифровке, а по интонации, ловя раздражение клиента до того, как он перейдёт на крик. Разработчик показывает скриншот интерфейса и просит собрать прототип. А система, следящая за видеопотоком с производства, замечает дым раньше датчиков.
Цена вопроса и подводные камни
Обработка звука и видео требует в разы больше вычислений, чем текст, поэтому такие запросы ощутимо дороже — эксперты по машинному обучению советуют трезво считать экономику до перевода бизнес-процессов на «мультимодальные рельсы». Добавим сюда приватность: когда ассистент постоянно слушает и смотрит, граница между помощью и наблюдением становится тонкой. И всё же направление задано — интерфейс всё ближе к разговору с собеседником, у которого идеальная память, мгновенная реакция и ни секунды раздражения.