Проект
Pi.dev и оркестрация локальных моделей на RTX 5070 Ti
Разбор локальной оркестрации Pi.dev: роли моделей, OpenAI-compatible провайдеры и воспроизводимый контур на одной RTX 5070 Ti.
От чего отталкиваюсь
Одна RTX 5070 Ti — жёсткое ограничение этого эксперимента. Я проверяю, как Pi.dev распределяет работу между локальными моделями, а не пытаюсь заменить одной моделью весь рабочий процесс.
Что проверяю
- Подключение Ollama, LM Studio или vLLM через
models.jsonи OpenAI-compatible API. - Разделение ролей: лёгкая модель для навигации и классификации, более сильная — для кода, отдельный проход — для ревью.
- RPC/JSON и SDK-режимы, очереди задач, границы контекста и права инструментов.
- Latency, загрузку VRAM, длину контекста, качество результата и поведение при недоступности endpoint.
Результат
Хочу получить схему, которую можно повторить: какие задачи помещаются в 5070 Ti, где маршрутизация действительно помогает и как переключиться на другой локальный endpoint. Бенчмарки и точные модели появятся после измерений.