Практическое руководство по созданию корпоративных ИИ-систем: архитектура, агенты и контроль затрат
DeepSeek и Claude устроили перепалку из-за порога 0.7: экономия или магия
Статья представляет практическое руководство по созданию enterprise AI системы для финансового риск-менеджмента. Рассматриваются ключевые вызовы: достоверность, производительность, комплаенс и стоимость токенов. Предлагается архитектура с многоуровневым поиском, тремя специализированными агентами, трёхуровневым кэшированием, динамической подгрузкой промптов и автоматической проверкой фактов. Целевые показатели — 10 млн запросов в день, задержка P95 <800 мс и точность рекомендаций >85%. Описана реализация на Java/Python, включая деплой на Kubernetes с GPU-пулом. Материал полезен разработчикам, стремящимся создавать надёжные, быстрые и экономичные ИИ-сервисы с акцентом на контроль стоимости токенов.
В корпоративной среде внедрение ИИ требует решения проблем достоверности, высокой задержки, комплаенса и стремительно растущих расходов на токены. Данное руководство демонстрирует, как за пять дней построить систему поддержки принятия решений для оценки кредитных рисков, способную обрабатывать 100 000 запросов в сутки с задержкой менее 800 миллисекунд и долей галлюцинаций ниже 1%. Исходная проблема: кредитные аналитики тратили до 45 минут на изучение десятков документов по каждой заявке, а целевые метрики включают доступность 99,99%, точность рекомендаций выше 85%, обязательную прослеживаемость источников и трехлетнее хранение аудита. Архитектура строится на шести уровнях: API-шлюз Kong с ограничением скорости и канареечными релизами, процессный движок Activiti, объединенный с LLM для сложных согласований, ядро оркестрации агентов, гибридный поисковый слой на базе Milvus, Elasticsearch и графовой Neo4j, модельный шлюз с маршрутизацией (легкие модели для снижения затрат, тяжелые — как запасной вариант) и инфраструктура Kubernetes с vGPU для динамического выделения видеопамяти. Управление промптами вынесено в sidecar-контейнер Prompt Engine, что позволяет менять логику без перевыпуска основного сервиса. Поскольку чисто векторный поиск дает лишь 70% точности, реализована трехступенчатая обработка: классификация запроса, гибридный поиск (векторный, полнотекстовый, графовый) и реранкинг. Три специализированных агента — поисковый, работающий с разнородными источниками; агент правил на Drools, выполняющий детерминированные проверки; и агент-рассуждения, использующий LLM только для итогового синтеза — взаимодействуют по паттерну Saga. До 60% запросов повторяются, поэтому внедрено трехуровневое кэширование: семантическое, по точному совпадению и кэш результатов. Это критически важно для контроля стоимости токенов. Качество обеспечивается набором из 200 эталонных кейсов для регрессионного тестирования при каждом релизе и автоматической постгенерационной проверкой: легковесная NLI-модель оценивает достоверность вывода, и при показателе ниже 0,7 запускается повторная генерация или вмешательство человека. Обратная связь от пользователей (принято, изменено, отклонено) собирается для формирования датасета обучения с подкреплением; раз в месяц выполняется дообучение модели или оптимизация промптов. В итоге разработчик получает полный набор артефактов: диаграммы высокодоступной архитектуры, код на Java и Python, результаты нагрузочного тестирования и эксплуатационную документацию, включая процедуры серых релизов и отката. Это готовый шаблон для создания промышленных ИИ-сервисов, отвечающих жестким enterprise-требованиям по надежности, быстродействию и экономичности.