Пользователи ИИ-помощника ГигаЧат теперь могут воспользоваться обновлённой нейросетью GigaChat Audio. Эта продвинутая языковая модель имеет возможность обрабатывать аудиофайлы и голосовые сообщения без необходимости предварительного преобразования речи в текст. Искусственный интеллект стал способен распознавать интонацию пользователя, что значительно расширяет возможности обработки звуковой информации. Подробности о нововведениях можно найти на сайте Vishime.Ru.
Антон Фролов, старший вице-президент и руководитель блока «Развитие генеративного ИИ» Сбербанка, отметил: «Голос — самый естественный способ общения с технологией, но и самый требовательный: любая ошибка в распознавании или неверно считанная эмоция сразу разрушает доверие к ассистенту. Поэтому мы считаем аудио точкой роста для рынка ИИ-помощников. Запуская эти модели в открытый доступ, мы даём мощный инструмент разработчикам и учёным. От синхронного голосового перевода до сервисов для людей с нарушениями речи — спектр применений у голосовых технологий очень широкий. А мультиязычность и возможность легкого обучения другим языкам открывает для них и международные перспективы».
Теперь ГигаЧат стал более эмпатичным: он способен распознавать, с позитивной или негативной эмоцией обращается к нему пользователь, анализируя интонацию, характеристики голоса и нюансы произношения. Это позволяет ИИ-ассистенту реагировать более уместно, например, отвечая мягче раздражённому пользователю или поддерживая хорошее настроение, когда человек делится положительными новостями.
Модель GigaChat Audio может обрабатывать записи длиной до трёх часов, а также ориентироваться внутри них. Пользователи могут задавать вопросы о конкретных моментах разговора, просить пересказать отдельные отрезки или получить саммари всей записи с указанием таймкодов. Нейросеть также умеет различать спикеров в записи, что может быть полезно для разбора совещаний и звонков, навигации по записям и протоколирования.
Кроме того, GigaChat теперь может запоминать важные факты для пользователей прямо из голосового диалога, опираясь на них в будущих сессиях. При повторном обращении ассистент будет учитывать ранее озвученные пожелания, например, формируя маршрут путешествия с учётом интересов пользователя. Функция памяти полностью контролируется пользователем: зафиксированные факты можно просмотреть, отредактировать или отключить в настройках профиля в любой момент.
По результатам внутренних тестов новая модель GigaChat Audio показывает уровень понимания и ответов на голосовые запросы, сопоставимый с лучшими мировыми аналогами. Это подтверждается тестом Arena Hard Audio, где нейросети в «слепую» сравнивают ответы различных моделей на одни и те же голосовые вопросы. GigaChat Audio продемонстрировала 75% побед, что близко к результату Gemini-3-Flash-preview (77,5%) и значительно больше, чем у Gemini-2.5-Pro (62%). В замерах точности распознавания эмоций новая модель Сбера достигает 80%, что выше, чем у модели Qwen3-Omni-30B (70%) или Kimi-Audio (62%).
Что касается доступности для разработчиков, команда Сбербанка выложила в открытый доступ облегчённую версию GigaChat3.1-Audio-10B. Эта нейросеть поддерживает русский, английский и другие языки. На её основе можно создавать сервисы транскрибации, тренажёры произношения, инструменты для оценки качества озвучки, голосовые переводчики с пониманием контекста и сервисы пересказа длинных записей.
Также Сбер представил в открытом доступе GigaAM Multilingual — семейство моделей автоматического распознавания речи. Это первая российская открытая модель, работающая с несколькими языками, и она демонстрирует лучшее качество распознавания речи на русском языке среди существующих открытых решений. По результатам тестов GigaAM допускает в 1,5-2 раза меньше ошибок, чем ближайшие конкуренты. Модель поддерживает русский, английский, киргизский, казахский и узбекский языки и доступна в двух версиях: компактной, работающей на обычных процессорах, и флагманской, обеспечивающей более высокое качество распознавания.
GigaAM идеально подходит для кол-центров и голосовых ассистентов, расшифровки встреч, интервью и подкастов, а также для голосового ввода в приложениях и автосубтитров. Обе модели прошли предварительное обучение на большом числе языков, что позволяет их быстро дообучить для дополнительных, включая языки стран СНГ. Для этого достаточно всего лишь нескольких десятков часов размеченных аудиозаписей. Модели уже доступны на платформах GitVerse и Hugging Face. К тому же, научные статьи о новых моделях были приняты на одну из ведущих международных конференций по речевым технологиям Interspeech 2026.