В ClickHouse появились функции для работы с ИИ прямо из SQL

Команда ClickHouse представила набор встроенных AI-функций, которые позволяют вызывать большие языковые модели (LLM) и сервисы для создания векторных представлений непосредственно из SQL-запросов. Теперь операции вроде классификации текста, извлечения данных, перевода или генерации можно выполнять внутри базы данных, где уже хранятся исходные данные.

Новые возможности находятся в стадии бета-тестирования. Они появлялись постепенно в нескольких версиях ClickHouse: сначала были добавлены функции для генерации, классификации, извлечения и перевода текста, затем — создание эмбеддингов, фильтрация, скрытие персональных данных и оценка смысловой близости текстов.

ИИ-функции вместо отдельного конвейера обработки данных

Обычно сценарий с LLM выглядит так: данные выгружаются из базы, передаются во внешний сервис или отдельный пайплайн обработки, результаты сохраняются обратно. Такой подход требует дополнительной инфраструктуры и усложняет поддержку.

В ClickHouse предлагают другой вариант: перенести модель ближе к данным. Поскольку ClickHouse уже умеет хранить данные и работать с векторами, полный цикл для задач с генерацией с дополнением контекста (RAG) можно выполнять в одной системе — без отдельной векторной базы и дополнительных слоёв оркестрации.

Например, классификацию текста теперь можно выполнить обычным SQL-запросом:

SELECT aiClassify( 'I love this product!', ['positive', 'negative', 'neutral']);

В ответ ClickHouse вернёт одну из заданных категорий:

positive

Какие функции доступны

В версии 26.8 доступны следующие функции для работы с текстом:

  • aiClassify — классифицирует текст по заданным категориям;

  • aiExtract — извлекает структурированные данные из неструктурированного текста;

  • aiGenerate — генерирует текст по заданному запросу;

  • aiTranslate — переводит текст на указанный язык;

  • aiFilter — проверяет текст по условию на естественном языке и возвращает логическое значение;

  • aiRedact — находит и скрывает персональные данные в тексте.

Для работы с векторами добавлены:

  • aiEmbed — создаёт векторное представление текста;

  • aiSimilarity — оценивает смысловое сходство двух текстов.

Функции вызывают API выбранного ИИ-провайдера и возвращают результат в формате, который можно использовать как обычное значение ClickHouse.

Анализ данных без отдельного кода

В качестве примера разработчики использовали набор данных Hacker News с миллионами публикаций и комментариев.

С помощью aiClassify можно автоматически распределить записи по темам:

SELECT title, aiClassify( title, ['space', 'security', 'databases', 'startups', 'programming', 'other'] ) AS topicFROM hackernews;

Результат можно дальше обрабатывать обычными SQL-операциями: группировать, фильтровать и строить агрегаты.

Раньше подобная задача обычно требовала отдельного скрипта: выгрузить данные, отправить их в модель, обработать ответ и загрузить результаты обратно. Теперь часть таких сценариев можно выполнять непосредственно в запросах ClickHouse.

RAG-цикл внутри ClickHouse

Новые функции также позволяют реализовать основные этапы RAG-подхода в одной системе:

  1. Создать эмбеддинги при загрузке данных с помощью aiEmbed().

  2. Хранить тексты и векторные представления рядом.

  3. Индексировать данные для поиска по близости.

  4. Выполнять поиск похожих объектов.

  5. Передавать найденный контекст в aiGenerate() для генерации ответа.

При этом aiSimilarity() подходит для более простых задач — например, поиска похожих документов или удаления дублей по смыслу.

Контроль расходов на запросы к моделям

В отличие от обычных функций ClickHouse, вызовы ИИ-моделей имеют стоимость в токенах и зависят от количества обращений к внешнему сервису.

Чтобы избежать неожиданных расходов, разработчики добавили ограничения на использование AI-функций:

  • максимальное количество входных токенов на запрос;

  • максимальное количество выходных токенов;

  • максимальное количество обращений к API модели.

Например, можно ограничить число вызовов модели:

SELECT title, aiClassify(title, ['space', 'security', 'databases'])FROM hackernewsLIMIT 5000SETTINGS ai_function_max_api_calls_per_query = 100;

Это позволяет контролировать расходы при обработке больших объёмов данных.

Что учитывать перед использованием в продакшене

Разработчики отдельно отмечают несколько ограничений:

  • результаты работы модели могут отличаться при повторных запусках одного и того же запроса;

  • стоимость и время выполнения растут вместе с количеством обрабатываемых строк;

  • входные данные для модели требуют осторожного обращения из-за риска prompt injection;

  • провайдер модели получает данные после завершения TLS-шифрования, поэтому важно учитывать требования безопасности.

Для рабочих сценариев рекомендуется сначала запускать запросы на небольших объёмах данных и использовать ограничения по квотам.

Новые AI-функции превращают ClickHouse из аналитической базы данных в инструмент, где часть задач машинной обработки текста и работы с LLM можно выполнять прямо на уровне SQL.

Подборка бесплатных уроков от преподавателей курсов Otus на сентябрь уже доступна в дайджесте.

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев