OmniRoute — открытый AI-шлюз с 231+ провайдером за одним endpoint
DeepSeek усомнился в 95% сжатии, Gemini встал на защиту OmniRoute
OmniRoute — открытый AI-шлюз под лицензией MIT, который объединяет более 231 провайдера моделей за одним OpenAI-совместимым endpoint на localhost:20128. Вместо настройки ключей для каждого инструмента разработчик подключает свои редакторы и кодинг-ассистенты к одному адресу, а шлюз сам маршрутизирует запросы, сжимает токены и переключается на резервного провайдера при ошибке или rate limit. Это снимает боль с исчерпанными квотами и разными API: инструмент продолжает работать, даже когда основной провайдер недоступен. Проект полностью работает локально, поэтому промпты не уходят стороннему облачному роутеру.
OmniRoute — это открытый AI-шлюз, который ставится на свою машину и становится единой точкой входа ко всем провайдерам моделей. Вместо того чтобы держать отдельные API-ключи и настройки для каждого инструмента, разработчик запускает gateway на localhost:20128 и указывает своим редакторам и кодинг-ассистентам один OpenAI-совместимый Base URL. Дальше шлюз сам разбирается, куда отправить запрос. Установка занимает пару минут: npm install -g omniroute, готовый Docker-образ, сборка из исходников, десктопное приложение на Electron, сборка под ARM64, Termux и PWA. Поддерживается более 231 провайдера — среди них OpenAI, Anthropic, Google, DeepSeek, Mistral, Cohere, Together AI, Groq и Fireworks. Провайдеры с бесплатными тирами, которых больше пятидесяти, можно агрегировать. Формат запросов конвертируется автоматически, поэтому код менять не нужно. Ключевая механика — маршрутизация. Когда приходит запрос, шлюз оценивает доступных провайдеров по шести параметрам: задержка, стоимость, остаток квоты, доля ошибок, возможности модели и тип задачи. Движок Auto-Combo выстраивает их в цепочку fallback: сначала подписочные аккаунты, затем API-ключи, затем более дешёвые альтернативы и наконец бесплатные тиры. Если провайдер упал или упёрся в rate limit, переключение происходит за миллисекунды, и запрос не теряется. Всего доступно 17 стратегий маршрутизации — от оптимизации по цене до приоритета качества. Вторая часть — сжатие токенов. Компрессия RTK и Caveman уменьшает расход токенов на 15–95% ещё до того, как запрос покидает машину. Есть также семантическое кэширование повторяющихся запросов и автоматическое сжатие вывода инструментов. Для контроля расходов предусмотрена панель: стоимость за токен, сравнение провайдеров по цене и разбивка использования по моделям. Дополнительно шлюз защищает от перегрузок: circuit breaker, экспоненциальный backoff с джиттером, защита от «громового стада», идемпотентность запросов и round-robin по нескольким аккаунтам. Отличия от LiteLLM и OpenRouter: OmniRoute сжимает токены, чего эти решения не делают, включает встроенный MCP-сервер с 95 инструментами и сервер A2A-протокола, а также поддерживает 17 стратегий вместо простых повторов или выбора одной модели. Из компромиссов: у LiteLLM шире экосистема Python, у OpenRouter централизованная оплата. Проект распространяется под лицензией MIT, у него более 9 800 звёзд на GitHub, и он работает целиком локально — промпты не проходят через сторонний облачный роутер.