«Сбер» разрабатывает ИИ, который может одновременно слушать и говорить

Благодаря полному дуплексу беседа с ИИ почти не будет отличаться от общения с человеком.

«Сбер» разрабатывает голосовой искусственный интеллект с полным дуплексом. Такая система сможет одновременно слушать собеседника, обрабатывать его речь и формировать собственный ответ. Об этом сообщил директор по развитию технологий ИИ «Сбербанка» Сергей Марков.

Большинство современных голосовых ассистентов работают в полудуплексном режиме: пользователь говорит, система обрабатывает запрос, после чего отвечает. Для этих этапов могут использоваться разные нейросети. Полнодуплексная модель объединит процессы в одной системе и сможет продолжать слушать человека во время собственного ответа.

Это должно сократить задержку в диалоге с нескольких секунд до 160-320 мс — примерно до уровня естественной человеческой беседы. Такая архитектура также позволит ИИ реагировать на перебивания и изменения реплики без необходимости ждать, пока собеседник закончит говорить.

При добавлении видеомодальности система сможет одновременно видеть пользователя и управлять движениями собственного видеоаватара. Это позволит использовать технологию не только для голосового общения, но и для более реалистичного взаимодействия с цифровым персонажем.

Первой подобное решение представила французская компания Kyutai. В 2024 году она выпустила модель Moshi с поддержкой полного дуплекса. Позже аналогичные разработки появились у Google и OpenAI — Gemini Live и GPT-Live.

Источник: hi-tech.mail.ru

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев