volodya@agency:~$ cd /services ← все услуги
volodya@agency:~/ai-automation$ ./ai-integrations.sh

AI-ассистенты

Разработка ассистентов и чат-ботов на Claude, GPT и открытых LLM: поддержка клиентов, внутренние помощники по документам, RAG-поиск по вашей базе знаний. Интеграция с CRM, Slack, Telegram и внутренними системами. 15+ лет практики уровня CTO.

Claude · GPT · open-source RAG по вашей базе векторный поиск оценка за 24ч

$ cat описание.md

Ассистент полезен ровно настолько, насколько он подключён к вашим данным и процессам. Поэтому работа начинается не с промпта, а с задачи: что именно должен делать бот, на каких данных отвечать, где проходит граница между автоматическим ответом и передачей человеку. Фиксируются сценарии, источники знаний и метрика качества — иначе оценить результат невозможно.

Модель подбирается под задачу и бюджет. Claude (Sonnet, Opus) — сложные рассуждения, работа с длинным контекстом и документами. GPT (OpenAI) — универсальные сценарии и функции. Открытые модели (Llama, Qwen, Mistral) через vLLM или Ollama — когда данные нельзя отдавать вовне и нужен self-hosted контур. В одном проекте модели комбинируются: дешёвая для классификации, сильная для генерации.

Ответы по вашим данным строятся на RAG: документы разбиваются на фрагменты, векторизуются и складываются в векторную БД (Qdrant, pgvector, Weaviate). На запрос подбираются релевантные куски и подаются модели как контекст — так бот отвечает фактами из вашей базы, а не выдумывает. Добавляются реранкинг, цитирование источников и фильтры доступа, чтобы человек видел только то, что ему разрешено.

Ассистент связывается с рабочими системами через инструменты (function calling): создать тикет, найти заказ в CRM, свериться с прайсом, эскалировать оператору. Каналом может быть виджет на сайте, Telegram, Slack, WhatsApp или голосовой контур. По коду — логирование диалогов, оценка качества ответов, защита от prompt injection и контроль стоимости токенов, чтобы систему было видно в проде и дёшево поддерживать.


$ uname -a  # стек

LLMClaude Sonnet/OpusGPT-4oLlama 3QwenMistral
RAGQdrantpgvectorWeaviateLangChainLlamaIndex
ЭмбеддингиOpenAI embeddingsBGEE5реранкинг
КаналыTelegramSlackWhatsAppвеб-виджетAPI
БэкендPythonFastAPIRabbitMQRedisPostgreSQL
ИнфраDockervLLMOllamaPrometheusself-hosted

$ ls -1 что-входит/

Чат-боты поддержки
Ответы на типовые вопросы клиентов по вашей базе, эскалация сложных кейсов оператору, работа в веб-виджете и мессенджерах.
Внутренние помощники
Ассистент по регламентам, документации и коду для сотрудников — поиск ответа за секунды вместо перебора файлов.
RAG по базе знаний
Ответы фактами из ваших документов с цитированием источников, векторный поиск, реранкинг, фильтры доступа.
Обработка документов
Извлечение полей из счетов, договоров, PDF и сканов, классификация, суммаризация, структурирование в JSON.
Function calling
Бот вызывает ваши API: создаёт тикеты, ищет заказы в CRM, сверяется с прайсом, оформляет заявки.
Мультиканальность
Единый ассистент в Telegram, Slack, WhatsApp, на сайте и через API — с общей историей и контекстом.
Self-hosted контур
Открытые модели на вашем железе через vLLM/Ollama, когда данные нельзя отдавать во внешние сервисы.
Оценка качества
Логирование диалогов, разметка ответов, метрики точности и разрешённых обращений, регресс на наборе кейсов.
Защита и контроль стоимости
Фильтры prompt injection, лимиты токенов, кэширование, маршрутизация дешёвая/сильная модель под задачу.
Документация и передача
Описание сценариев, источников знаний и настроек, инструкции по обновлению базы и промптов.

$ grep -r "типовые задачи"


$ ./process.sh --steps

Разбор задачи

Сценарии, источники данных, каналы, граница автоответа и эскалации. Фиксируется метрика качества и оценка.

Прототип на данных

Быстрый RAG-прототип на выборке ваших документов. Проверяется, что модель отвечает фактами и по делу.

Разработка итерациями

Интеграции, function calling, каналы, фильтры доступа. Небольшие релизы с оценкой ответов на кейсах.

Оценка и приёмка

Прогон на наборе реальных вопросов, замер точности, настройка защиты и стоимости токенов, документация.

Сопровождение

Опционально: обновление базы знаний, донастройка промптов, мониторинг качества и расходов на API.


$ whoami && echo $RESULT

Для кого

  • Поддержка, тонущая в потоке однотипных вопросов
  • Компании с большой базой документов и регламентов
  • Продукты, которым нужен AI-виджет или бот в мессенджере
  • Бизнес с чувствительными данными и требованием self-hosted
  • Команды, желающие проверить AI-гипотезу без раздувания штата

Результат

  • Бот снимает поток типовых обращений с операторов
  • Ответы — фактами из вашей базы, со ссылками на источник
  • Сотрудники находят ответ за секунды, а не за полчаса
  • Прозрачная стоимость токенов и контроль расходов на API
  • Логи диалогов и метрики качества — видно, как бот работает

$ cat faq.md

Какую модель будете использовать — Claude, GPT или открытую?
Под задачу и требования к данным. Claude — сложные рассуждения и длинные документы; GPT — универсальные сценарии; открытые модели (Llama, Qwen, Mistral) через vLLM/Ollama — когда данные нельзя отдавать во внешние сервисы. Часто в проекте комбинируются дешёвая модель для классификации и сильная для генерации.
Бот не будет выдумывать ответы?
Ассистент отвечает на основе ваших документов через RAG: подбираются релевантные фрагменты и подаются модели как контекст, ответ сопровождается ссылкой на источник. Если в базе нет ответа — бот честно говорит об этом и передаёт вопрос человеку, а не фантазирует.
Наши данные не утекут в OpenAI или Anthropic?
Зависит от контура. Через API провайдеров данные обрабатываются на их стороне (для бизнес-тарифов — без обучения на них). Если это неприемлемо — разворачиваем открытую модель на вашем железе, тогда данные не покидают ваш периметр. Выбор обсуждается на старте.
Можно подключить бота к нашей CRM и внутренним системам?
Да. Через function calling ассистент вызывает ваши API: ищет заказы, создаёт тикеты, сверяется с прайсом. Есть интеграции с amoCRM, Bitrix24, helpdesk-системами, а также с Telegram, Slack и веб-виджетом.
Сколько это стоит в эксплуатации?
Основная статья — токены LLM. Стоимость снижается кэшированием, маршрутизацией запросов на дешёвую модель где можно, и лимитами. На старте считаю прогноз расходов по вашему объёму обращений, в проде — мониторинг и алерты по бюджету.
Как поймёте, что бот отвечает хорошо?
На старте фиксируем метрику: доля корректных ответов, доля разрешённых без оператора. Собирается набор реальных вопросов, на нём прогоняется регресс при каждом изменении промпта или базы. Диалоги логируются и размечаются.
Кому принадлежит решение и как устроена передача?
Код, промпты и настройки — ваши, лежат в вашем репозитории. На передаче — документация по сценариям, обновлению базы знаний и промптов, чтобы вы могли развивать ассистента сами или силами своей команды.
Нужен AI-ассистент или чат-бот? Опишите задачу — вернусь с оценкой в течение 24ч.
Владимир Смирнов · CTO · Fullstack · DevOps |все услуги |volodya.pro |god@volodya.pro