Как ИИ «слышит» и «понимает» человеческую речь на совещаниях

ИИ-ассистенты для встреч умеют расшифровывать диалоги, выделять суть и даже фиксировать задачи с ответственными. Но как они работают? Почему все еще ошибаются и что делают разработчики, чтобы их улучшить?

Каждый день в мире проходят сотни миллионов онлайн-совещаний. С развитием технологий появилась возможность массово записывать и расшифровывать их — и бизнес активно ею пользуется. Мировой рынок распознавания речи и голоса растет огромными темпами: по данным Fortune Business Insights, в 2025 году он оценивался в $19,09 млрд, а к 2034 году ожидается его увеличение более чем в пять раз — до $104,05 млрд.

Вместе со спросом на такие решения растут ожидания бизнеса и пользователей. Сегодня от ИИ-ассистентов для встреч все чаще ждут не просто расшифровки, а настоящего «понимания» сути разговора. За этой задачей стоит сложнейший процесс на стыке акустики, статистики и лингвистики.

Как ИИ превращает звук в текст

«Слух» ИИ-ассистента для встреч — это система распознавания речи (Automatic Speech Recognition — ASR). Она переводит звук в текст. Вот из каких этапов состоит этот процесс:

Оцифровка. Микрофон улавливает звуковые волны и преобразует их в электрический сигнал. Дальше аналого-цифровой преобразователь превращает его в цифровой поток, делая 16 тысяч замеров — «снимков» звука — в секунду: это стандарт для систем распознавания речи. Этот поток и есть основа для всей дальнейшей работы.Подготовка сигнала и выделение акустических признаков. Сначала аудиотракт конференции убирает лишнее: подавляет эхо, фоновый шум и вибрации — этим занимаются отдельные алгоритмы, еще до распознавания. Затем очищенный сигнал переводится в компактное представление — спектрограмму, которая показывает, какие частоты и с какой силой звучат в каждый момент времени. Именно с ней дальше работают нейросети.Акустическое моделирование. На этом этапе в дело вступают нейросети: энкодер и декодер. Энкодер — нейросеть-кодировщик — превращает акустические признаки в набор чисел. Декодер — нейросеть-расшифровщик — по этому коду вычисляет наиболее вероятную последовательность символов и собирает из них текст.Языковое моделирование. Даже при высоком качестве исполнения предыдущих этапов ASR может ошибаться. Например, фразы «наша компания» и «наша кампания» на слух неразличимы, а смысл у них разный. Снизить вероятность ошибок при расшифровке спорных слов/фраз помогает подключение к процессу больших языковых моделей (Large Language Models — LLM): они анализируют, какие сочетания слов чаще встречаются в ходе беседы, и выбирают самые вероятные варианты. Так, если на совещании обсуждают рекламные бюджеты и охваты, модель «поймет», что речь, скорее всего, идет о «кампании», а если перечисляют стратегических партнеров — о «компании».Источник: hi-tech.mail.ru

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев