Стартап Abliteration.ai начал продавать через API доступ к нейросети GLM-5.3 с ослабленными системами защиты

Стартап Abliteration.ai начал предлагать модифицированные версии моделей с открытыми весами, у которых отключены защитные фильтры. В их числе оказалась недавно выпущенная модель GLM-5.3 от компании Z.ai. Пользователи могут отправлять запросы к этим моделям через веб‑браузер или использовать API.

Стартап заявил, что его цель — дать пользователям возможность проводить «наступательные кибероперации, тесты на проникновение (red‑teaming) и проверку работы ИИ‑агентов — задачи, от выполнения которых отказываются другие модели». 

Аблитерация — давно известный метод в сообществе разработчиков моделей с открытым исходным кодом. Исследователи и программисты годами удаляли ограничения из моделей с открытыми весами, и на платформе Hugging Face уже размещены тысячи таких модифицированных версий.

Abliteration.ai основали в конце прошлого года. Стартап переводит этот метод из разряда нишевых практик open‑source‑сообщества в формат коммерческого, общедоступного сервиса.

Журналисты TechCrunch воспользовались сервисом: они быстро создали учётную запись и бесплатно отправили запросы к модифицированной версии GLM-5.3 через веб‑браузер. Модель без колебаний выполнила задания: написала программу на Python для кражи сохранённых паролей из браузера Chrome и составила подробный протокол выращивания опасного для человека патогена в домашних условиях.

Сооснователь Abliteration.ai по имени Девон сообщил, что стартап заключил соглашения с крупными облачными провайдерами, оплачивая услуги за счёт выручки от клиентов. Они пока не привлекали венчурный капитал, но ведут соответствующие переговоры. 

Критики утверждают, что массовое распространение моделей, подвергшихся процедуре «аблитерации», может привести к реальному ущербу. Эндрю Юн, руководитель исследовательского направления в некоммерческой организации CivAI, занимающейся вопросами безопасности ИИ, заявил изданию TechCrunch, что аблитерация позволяет «модифицировать модель так, чтобы она превратилась в социопата».

«Сюда можно ввести буквально что угодно, и модель выполнит запрос. Когда говорят об отключении защитных механизмов в ИИ‑моделях, имеют в виду именно это… Я ожидаю, что в ближайшем будущем мы увидим случаи использования таких модифицированных, „аблитерированных“ моделей во вредоносных целях», — сказал Юн. 

Большинство экспертов, опрошенных TechCrunch, считают, что этот процесс уже не остановить. Однако, если предотвратить снятие ограничений с моделей с открытыми весами практически невозможно, существуют другие сферы, где может вмешаться государство. В недавней статье Юн предложил обязать провайдеров использовать классификаторы для обнаружения и блокировки действий, связанных с вредоносными кибератаками или созданием биологического оружия. Он также отметил необходимость проверки личности клиентов компаниями, предоставляющими прямой доступ к мощным графическим процессорам (GPU), и блокировки доступа в случаях, когда есть основания подозревать опасное использование технологий.

Abliteration.ai предлагает клиентам уровень модерации, позволяющий самостоятельно настраивать любые необходимые ограничения. Сама платформа имеет базовые защитные механизмы — например, в ходе тестирования журналистами модель отказалась давать инструкции по совершению самоубийства. Девон утверждает, что работает над внедрением дополнительных мер для предотвращения сценариев насилия.

Abliteration.ai также не применяет процедуры KYC (проверки личности клиента), ограничиваясь лишь фиксацией данных кредитной карты, использованной для оплаты услуг.

«Никому не хочется нести ответственность за то, что кто‑то совершит безумный поступок… так где же проходит граница ответственности компании?» — задался вопросом Девон. 

Это порождает вопросы, с которыми предстоит столкнуться представителям отрасли и государственным органам по мере выпуска всё более мощных моделей с доступными для скачивания весами.

Основатель Abliteration.ai и другие сторонники этого подхода утверждают, что демократизация доступа к передовым моделям, не имеющим цензурных ограничений, — это лучшая форма защиты.

«Суть моделей, из которых удалены защитные фильтры, заключается в том, что они способны моделировать поведение злоумышленников. Преимущество в том, что теперь защитники могут действовать так же», — отметил Девон. 

Он отмечает, что среди клиентов Abliteration.ai уже есть несколько британских и европейских стартапов, специализирующихся на «ред‑тиминге». Они помогают банкам, авиалиниям и предприятиям критической инфраструктуры укреплять системы кибербезопасности.

«Один из наших крупных клиентов занимается тестированием банковских ИИ‑агентов, и сегодня они не смогли бы использовать стандартные модели „из коробки“ для проведения таких проверок», — пояснил Девон.

Представители ряда компаний, занимающихся тестированием ИИ‑агентов, согласны с Девоном в том, что злоумышленники уже используют собственные модели для проведения враждебных атак. Однако мнения относительно того, насколько важную роль такие модели играют в этом процессе, разделились.

Хотя Девон утверждает, что «аблитерация» моделей необходима для качественного тестирования ИИ‑агентов, некоторые специалисты говорят, что не используют их в повседневной работе. Вместо этого они полагаются на возможность быстрой донастройки (файн‑тюнинга) моделей с открытыми весами.

Ахмед Али, генеральный директор компании Fabraix (занимающейся тестированием ИИ‑агентов), говорит, что его фирма предпочитает донастройку открытых моделей.

«Если вы действительно попытаетесь нанести реальный ущерб — например, в киберпространстве или биологической сфере, — такая модель окажется менее эффективной», — отметил он.

Алессио Ломушио, технический директор Safe Intelligence, согласился с тем, что снижение функциональности возможно, однако полагает, что «аблитерированные» модели все же позволяют провоцировать определённое поведение, полезное для стресс‑тестирования систем.

«На данный момент они не являются частью нашего рабочего процесса. Если взглянуть на модели с открытыми весами — вплоть до самого последнего поколения, — то взломать их и заставить делать то, что нам нужно, было совсем несложно», — сообщил TechCrunch Дэвид Слейтер, основатель и главный архитектор платформы кибербезопасности Armadin. Он добавил, что изучает метод «аблитерации» и считает, что «крайне важно побуждать открытое сообщество разбираться в возможностях таких моделей».

«В противном случае всё это будет происходить за закрытыми дверями, втайне от общественности. А когда это происходит открыто, исследователи получают необходимые инструменты. Это даёт нам возможность понять, где именно проходит передний край технологий, и осознать потенциальный вред», — заключил Слейтер. 

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев