AI Infra · LLM-прокси

LLM-прокси с роутингом и сжатием промптов

Единый OpenAI-совместимый эндпоинт, который маршрутизирует запросы между моделями и сжимает промпты на лету. Меньше токенов — меньше счёт за LLM.

PythonFastAPIhttpxllmlinguatransformersWeb UI

Один эндпоинт вместо зоопарка моделей — и счёт за токены ниже

Подключаете приложение к одному /v1, а 9router сам выбирает модель под задачу и сжимает контекст перед отправкой апстриму. Это снижает расход токенов и латентность, а маршруты и ключи меняются через веб-панель без перезапуска.

Возможности

Что внутри

🔀

Мульти-модельный роутинг

Один /v1-эндпоинт раскидывает запросы по разным апстримам и моделям по заданным правилам.

🗜️

6 движков сжатия

Сжатие промптов (включая llmlingua) — меньше токенов на вход без потери смысла.

🎛️

Веб-панель управления

Маршруты, модели и ключи настраиваются через UI на лету, без правки кода.

🌊

Потоковая отдача

Прозрачный стриминг ответов от апстрима к клиенту.

💸

Экономия бюджета

Сжатие + роутинг на дешёвые модели там, где не нужна топовая — прямая экономия.

🔌

OpenAI-совместимость

Drop-in замена: меняете base_url — остальной код приложения не трогаете.

Архитектура

Как это работает

Client /v1
Router
Compressor
Upstream LLM

Запрос → выбор маршрута → сжатие промпта → апстрим (OpenAI / OpenRouter / локальная модель) → потоковый ответ обратно клиенту.

Стек

Технологии

PythonFastAPIhttpxllmlinguatransformerstiktokenWeb UIDocker

Нужно что-то похожее?

Опишите задачу — отвечу быстро и сделаю рабочее демо до оплаты.

Написать в Telegram →