Я вычислю тебя по бз-бз-бз: создали ИИ-устройство против малярии

Пока все внимание приковано к гонке ИИ-гигантов и большим потреблениям энергии, денег и т. п., на противоположном конце технологического спектра происходит тихая революция. На прошедшем в Женеве саммите ООН AI for Good представили портативный прибор для борбы с малярией и лихорадкой денге, разработанный группой исследователей, включая доцента UOW Киранa Триведи.

Для эпидемиологов это прорыв: традиционный мониторинг требует сбора проб воды, транспортировки личинок в лабораторию и их ручного анализа под микроскопом. Но с инженерной точки зрения куда интереснее другое — то, как именно полноценную нейросеть для обработки аудио удалось «утрамбовать» в микроконтроллер стоимостью $10.

Архитектура задачи

Все комары звучат одинаково только для человека, пытающегося заснуть. 

С точки зрения физики каждый вид имеет уникальную частоту взмахов крыльев и форму акустической волны:

  • Aedes — переносчик лихорадки денге и вируса Зика;

  • Anopheles — главный вектор малярии;

  • Culex — переносчик вируса Западного Нила.

Устройство с точностью 88,3% идентифицирует опасных комаров в реальном времени по звуку их взмахов крыльев. Главная особенность системы — она работает автономно на платах класса Arduino без подключения к интернету.

Киран Триведи и устройство. Источник.Киран Триведи и устройство. Источник.

Их базовые частоты и спектральные подписи различаются — зачастую на десятки герц и более, плюс по структуре гармоник. Задача звучит просто: взять сигнал с микрофона, построить спектрограмму и классифицировать ее нейросетью. Однако попытка запустить классическую CNN или CRNN на ограниченном железе упирается в жесткие ресурсы микроконтроллеров: сотни килобайт RAM вместо десятков гигабайт VRAM.

+------------------------------------------------------------------+| FULL ML PIPELINE |+------------------------------------------------------------------+| 1. Обучение и подготовка (Cloud / GPU) || Сырой звук -> Спектрограммы -> Обучение тяжелой CNN/CRNN |+------------------------------------------------------------------+ | v| 2. Оптимизация (Quantization & Pruning) || FP32 -> INT8, удаление лишних весов, сборка в TFLite Micro |+------------------------------------------------------------------+ | v| 3. Offline-инференс (Edge / TinyML) || Микрофон -> DSP (FFT) -> INT8-модель на MCU -> Результат |+------------------------------------------------------------------+

Как устроена разработка

Распространенное заблуждение о TinyML заключается в том, что микроконтроллеры делают все сами. По-настоящему же, процесс разделен на два этапа.

Этап 1. Тяжелое обучение и конвертация спектрограмм

Модель не может родиться на микроконтроллере. Первичный датасет (в случае исследования — публичные библиотеки аудиозаписей полета комаров) требует серьезной предварительной обработки.

Аудиосигнал нарезается на короткие фреймы и превращается в Mel-Spectrograms или MFCC (Mel-Frequency Cepstral Coefficients). Это переводит задачу из области аудио в область компьютерного зрения: нейросеть учится искать паттерны на «картинках» частотного спектра.

Чтобы модель научилась выделять паттерны крыльев на фоне шума ветра и тропического дождя, требуются сотни эпох обучения и валидации. На этом этапе все еще используют GPU-кластеры, так как перебор гиперпараметров и аугментация аудиоданных требуют высокой параллельной вычислительной мощности.

Этап 2. Квантование и дистилляция 

Когда модель показала целевую точность (в эксперименте Триведи — 88,3%), начинается процесс ее жесткого урезания.

Начинается все с квантования, перевода весов из формата плавающей точки FP32 в целочисленный INT8. Это сокращает размер модели в четыре раза и позволяет выполнять математические операции на базовых ALU микроконтроллера без вызова программной эмуляции float.

Дальше Pruning, или удаление из нейросети связей и нейронов, имеющих близкий к нулю вклад в итоговый результат. 

Потом компиляция под C++. Итоговый граф переводится в код через фреймворки вроде TensorFlow Lite for Microcontrollers (TFLite Micro) или Edge Impulse. Модель превращается в обычный массив байтов, вшиваемый непосредственно в флэш-память чипа.

Как правило, после квантования и prunіng медианная модель для такой задачи занимает порядка сотен килобайт (например, 100–200 КБ)

Каталог готовых ИИ-моделей

Сервис для запуска и управления LLM в облаке Selectel. Выберите модель, конфигурацию и получите готовый эндпоинт для работы с ней.

Подробнее →

Реальные инженерные ограничения

Несмотря на красивую демонстрацию на саммите ООН, при переносе такой системы из лаборатории «в поле» инженеры неизбежно столкнутся с двумя проблемами.

Проблема

Лабораторные условия

Реальные тропики

Инженерное решение

Акустический шум

Чистые датасеты, изолированный звук

Ветер, дождь, шум транспорта, прочие насекомые

Использование аппаратных MEMS-микрофонов с направленностью + первичные DSP-фильтры

Автономия

Питание от USB-порта

Работа 24/7 в удаленных локациях

Сон микроконтроллера по таймеру / Активация по пороговому уровню громкости (Wake-on-Sound)

Прогноз: от изолированных чипов к IoT-сетям

Авторы проекта видят финальную цель не в создании отдельных приборов, а в построении распределенной сети датчиков.

Концепция похожа на работы сервисов вроде Waze или навигаторов: локальный чип определяет тип опасности, не тратит трафик на передачу аудиофайлов, а отправляет в сеть лишь короткий служебный пакет (координаты, timestamp, ID вида).

По замыслу авторов такие сети могли бы давать тепловые карты активности переносчиков и, потенциально, позволить реагировать на вспышки раньше, чем это отражается в статистике заболеваний.

А как вы думаете, есть ли у Edge-вычислений шанс забрать ощутимую долю рынка у классических облачных API? Делитесь мнением в комментариях.

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев