Выпуск новостей завершён 15 сентября 2026. Материалы сохранены на дату публикации. Перейти к инструкциям →

Архив · Полный материал · Хабр

В ClickHouse появились функции для работы с ИИ прямо из SQL

Команда ClickHouse добавила в систему набор AI-функций, которые позволяют обращаться к большим языковым моделям и работать с эмбеддингами прямо из SQL-запросов. Теперь задачи вроде классификации текста, извлечения данных и построения RAG-сценариев можно выполнять на уровне самой аналитической базы,…

ИИ · Хабрkmoseenk (OTUS)4 минуты
Перейти к тексту ↓
В ClickHouse появились функции для работы с ИИ прямо из SQL
Хабр
Коротко о главномРазвернутьСвернуть
  1. Команда ClickHouse представила набор встроенных AI-функций, которые позволяют вызывать большие языковые модели (LLM) и сервисы для создания векторных представлений непосредственно из SQL-запросов.
  2. Теперь операции вроде классификации текста, извлечения данных, перевода или генерации можно выполнять внутри базы данных, где уже хранятся исходные данные.
  3. Новые возможности находятся в стадии бета-тестирования.

Команда ClickHouse представила набор встроенных AI-функций, которые позволяют вызывать большие языковые модели (LLM) и сервисы для создания векторных представлений непосредственно из SQL-запросов. Теперь операции вроде классификации текста, извлечения данных, перевода или генерации можно выполнять внутри базы данных, где уже хранятся исходные данные.

Новые возможности находятся в стадии бета-тестирования. Они появлялись постепенно в нескольких версиях ClickHouse : сначала были добавлены функции для генерации, классификации, извлечения и перевода текста, затем — создание эмбеддингов, фильтрация, скрытие персональных данных и оценка смысловой близости текстов.

ИИ-функции вместо отдельного конвейера обработки данных

Обычно сценарий с LLM выглядит так: данные выгружаются из базы, передаются во внешний сервис или отдельный пайплайн обработки, результаты сохраняются обратно. Такой подход требует дополнительной инфраструктуры и усложняет поддержку.

В ClickHouse предлагают другой вариант: перенести модель ближе к данным. Поскольку ClickHouse уже умеет хранить данные и работать с векторами, полный цикл для задач с генерацией с дополнением контекста (RAG) можно выполнять в одной системе — без отдельной векторной базы и дополнительных слоёв оркестрации.

Например, классификацию текста теперь можно выполнить обычным SQL-запросом:

SELECT aiClassify(
'I love this product!',
['positive', 'negative', 'neutral']
);

В ответ ClickHouse вернёт одну из заданных категорий:

Какие функции доступны

В версии 26.8 доступны следующие функции для работы с текстом:

  • aiClassify — классифицирует текст по заданным категориям;
  • aiExtract — извлекает структурированные данные из неструктурированного текста;
  • aiGenerate — генерирует текст по заданному запросу;
  • aiTranslate — переводит текст на указанный язык;
  • aiFilter — проверяет текст по условию на естественном языке и возвращает логическое значение;
  • aiRedact — находит и скрывает персональные данные в тексте.
  • aiEmbed — создаёт векторное представление текста;
  • aiSimilarity — оценивает смысловое сходство двух текстов.

Функции вызывают API выбранного ИИ-провайдера и возвращают результат в формате, который можно использовать как обычное значение ClickHouse.

Анализ данных без отдельного кода

В качестве примера разработчики использовали набор данных Hacker News с миллионами публикаций и комментариев.

С помощью aiClassify можно автоматически распределить записи по темам:

SELECT
title,
aiClassify(
title,
['space', 'security', 'databases', 'startups', 'programming', 'other']
) AS topic
FROM hackernews;

Результат можно дальше обрабатывать обычными SQL-операциями: группировать, фильтровать и строить агрегаты.

Раньше подобная задача обычно требовала отдельного скрипта: выгрузить данные, отправить их в модель, обработать ответ и загрузить результаты обратно. Теперь часть таких сценариев можно выполнять непосредственно в запросах ClickHouse.

RAG-цикл внутри ClickHouse

Новые функции также позволяют реализовать основные этапы RAG-подхода в одной системе:

  1. Создать эмбеддинги при загрузке данных с помощью aiEmbed() .
  2. Хранить тексты и векторные представления рядом.
  3. Индексировать данные для поиска по близости.
  4. Выполнять поиск похожих объектов.
  5. Передавать найденный контекст в aiGenerate() для генерации ответа.

При этом aiSimilarity() подходит для более простых задач — например, поиска похожих документов или удаления дублей по смыслу.

Контроль расходов на запросы к моделям

В отличие от обычных функций ClickHouse, вызовы ИИ-моделей имеют стоимость в токенах и зависят от количества обращений к внешнему сервису.

Чтобы избежать неожиданных расходов, разработчики добавили ограничения на использование AI-функций:

  • максимальное количество входных токенов на запрос;
  • максимальное количество выходных токенов;
  • максимальное количество обращений к API модели.

Например, можно ограничить число вызовов модели:

SELECT
title,
aiClassify(title, ['space', 'security', 'databases'])
FROM hackernews
LIMIT 5000
SETTINGS ai_function_max_api_calls_per_query = 100;

Это позволяет контролировать расходы при обработке больших объёмов данных.

Что учитывать перед использованием в продакшене

Разработчики отдельно отмечают несколько ограничений:

  • результаты работы модели могут отличаться при повторных запусках одного и того же запроса;
  • стоимость и время выполнения растут вместе с количеством обрабатываемых строк;
  • входные данные для модели требуют осторожного обращения из-за риска prompt injection;
  • провайдер модели получает данные после завершения TLS-шифрования, поэтому важно учитывать требования безопасности.

Для рабочих сценариев рекомендуется сначала запускать запросы на небольших объёмах данных и использовать ограничения по квотам.

Новые AI-функции превращают ClickHouse из аналитической базы данных в инструмент, где часть задач машинной обработки текста и работы с LLM можно выполнять прямо на уровне SQL.

Подборка бесплатных уроков от преподавателей курсов Otus на сентябрь уже доступна в дайджесте.
  • Блог компании OTUS
  • Искусственный интеллект