Ассистент полезен ровно настолько, насколько он подключён к вашим данным и процессам. Поэтому работа начинается не с промпта, а с задачи: что именно должен делать бот, на каких данных отвечать, где проходит граница между автоматическим ответом и передачей человеку. Фиксируются сценарии, источники знаний и метрика качества — иначе оценить результат невозможно.
Модель подбирается под задачу и бюджет. Claude (Sonnet, Opus) — сложные рассуждения, работа с длинным контекстом и документами. GPT (OpenAI) — универсальные сценарии и функции. Открытые модели (Llama, Qwen, Mistral) через vLLM или Ollama — когда данные нельзя отдавать вовне и нужен self-hosted контур. В одном проекте модели комбинируются: дешёвая для классификации, сильная для генерации.
Ответы по вашим данным строятся на RAG: документы разбиваются на фрагменты, векторизуются и складываются в векторную БД (Qdrant, pgvector, Weaviate). На запрос подбираются релевантные куски и подаются модели как контекст — так бот отвечает фактами из вашей базы, а не выдумывает. Добавляются реранкинг, цитирование источников и фильтры доступа, чтобы человек видел только то, что ему разрешено.
Ассистент связывается с рабочими системами через инструменты (function calling): создать тикет, найти заказ в CRM, свериться с прайсом, эскалировать оператору. Каналом может быть виджет на сайте, Telegram, Slack, WhatsApp или голосовой контур. По коду — логирование диалогов, оценка качества ответов, защита от prompt injection и контроль стоимости токенов, чтобы систему было видно в проде и дёшево поддерживать.
LLMClaude Sonnet/OpusGPT-4oLlama 3QwenMistral
RAGQdrantpgvectorWeaviateLangChainLlamaIndex
ЭмбеддингиOpenAI embeddingsBGEE5реранкинг
КаналыTelegramSlackWhatsAppвеб-виджетAPI
БэкендPythonFastAPIRabbitMQRedisPostgreSQL
ИнфраDockervLLMOllamaPrometheusself-hosted
Чат-боты поддержки
Ответы на типовые вопросы клиентов по вашей базе, эскалация сложных кейсов оператору, работа в веб-виджете и мессенджерах.
Внутренние помощники
Ассистент по регламентам, документации и коду для сотрудников — поиск ответа за секунды вместо перебора файлов.
RAG по базе знаний
Ответы фактами из ваших документов с цитированием источников, векторный поиск, реранкинг, фильтры доступа.
Обработка документов
Извлечение полей из счетов, договоров, PDF и сканов, классификация, суммаризация, структурирование в JSON.
Function calling
Бот вызывает ваши API: создаёт тикеты, ищет заказы в CRM, сверяется с прайсом, оформляет заявки.
Мультиканальность
Единый ассистент в Telegram, Slack, WhatsApp, на сайте и через API — с общей историей и контекстом.
Self-hosted контур
Открытые модели на вашем железе через vLLM/Ollama, когда данные нельзя отдавать во внешние сервисы.
Оценка качества
Логирование диалогов, разметка ответов, метрики точности и разрешённых обращений, регресс на наборе кейсов.
Защита и контроль стоимости
Фильтры prompt injection, лимиты токенов, кэширование, маршрутизация дешёвая/сильная модель под задачу.
Документация и передача
Описание сценариев, источников знаний и настроек, инструкции по обновлению базы и промптов.
Какую модель будете использовать — Claude, GPT или открытую?
Под задачу и требования к данным. Claude — сложные рассуждения и длинные документы; GPT — универсальные сценарии; открытые модели (Llama, Qwen, Mistral) через vLLM/Ollama — когда данные нельзя отдавать во внешние сервисы. Часто в проекте комбинируются дешёвая модель для классификации и сильная для генерации.
Бот не будет выдумывать ответы?
Ассистент отвечает на основе ваших документов через RAG: подбираются релевантные фрагменты и подаются модели как контекст, ответ сопровождается ссылкой на источник. Если в базе нет ответа — бот честно говорит об этом и передаёт вопрос человеку, а не фантазирует.
Наши данные не утекут в OpenAI или Anthropic?
Зависит от контура. Через API провайдеров данные обрабатываются на их стороне (для бизнес-тарифов — без обучения на них). Если это неприемлемо — разворачиваем открытую модель на вашем железе, тогда данные не покидают ваш периметр. Выбор обсуждается на старте.
Можно подключить бота к нашей CRM и внутренним системам?
Да. Через function calling ассистент вызывает ваши API: ищет заказы, создаёт тикеты, сверяется с прайсом. Есть интеграции с amoCRM, Bitrix24, helpdesk-системами, а также с Telegram, Slack и веб-виджетом.
Сколько это стоит в эксплуатации?
Основная статья — токены LLM. Стоимость снижается кэшированием, маршрутизацией запросов на дешёвую модель где можно, и лимитами. На старте считаю прогноз расходов по вашему объёму обращений, в проде — мониторинг и алерты по бюджету.
Как поймёте, что бот отвечает хорошо?
На старте фиксируем метрику: доля корректных ответов, доля разрешённых без оператора. Собирается набор реальных вопросов, на нём прогоняется регресс при каждом изменении промпта или базы. Диалоги логируются и размечаются.
Кому принадлежит решение и как устроена передача?
Код, промпты и настройки — ваши, лежат в вашем репозитории. На передаче — документация по сценариям, обновлению базы знаний и промптов, чтобы вы могли развивать ассистента сами или силами своей команды.