Благодаря полному дуплексу беседа с ИИ почти не будет отличаться от общения с человеком.
«Сбер» разрабатывает голосовой искусственный интеллект с полным дуплексом. Такая система сможет одновременно слушать собеседника, обрабатывать его речь и формировать собственный ответ. Об этом сообщил директор по развитию технологий ИИ «Сбербанка» Сергей Марков.
Большинство современных голосовых ассистентов работают в полудуплексном режиме: пользователь говорит, система обрабатывает запрос, после чего отвечает. Для этих этапов могут использоваться разные нейросети. Полнодуплексная модель объединит процессы в одной системе и сможет продолжать слушать человека во время собственного ответа.
Это должно сократить задержку в диалоге с нескольких секунд до 160-320 мс — примерно до уровня естественной человеческой беседы. Такая архитектура также позволит ИИ реагировать на перебивания и изменения реплики без необходимости ждать, пока собеседник закончит говорить.
При добавлении видеомодальности система сможет одновременно видеть пользователя и управлять движениями собственного видеоаватара. Это позволит использовать технологию не только для голосового общения, но и для более реалистичного взаимодействия с цифровым персонажем.
Первой подобное решение представила французская компания Kyutai. В 2024 году она выпустила модель Moshi с поддержкой полного дуплекса. Позже аналогичные разработки появились у Google и OpenAI — Gemini Live и GPT-Live.
Источник: hi-tech.mail.ru