13 сентября 2026 г. · 2 min
Тест локальной модели Qwen 3.8 27B через Pi.dev
Первый замер локальной модели в Pi.dev: качество текста устраивает, а скорость на текущих настройках составляет 12–14 токенов в секунду.
В тему harness и поисков экономии токенов для вайб-кодинга, делегирования рабочих задач и т.п. дошли руки до тестов локальных моделей на моём ПК через pi.dev. Базовая оркестрация настроена пока плохо: я привык к OpenClaw, а разобраться с настройками настолько глубоко пока не нахожу времени.
Идея в том, чтобы получить сабагента с более-менее вменяемым количеством параметров и не на супернизком кванте, который помогал бы экономить токены и закрывать несложные задачи.
Конфигурация
- RTX 5070 Ti 16 GB
- Ryzen 9800X3D
- 64 GB RAM
Модель — Qwen3.8 27B. Опытным путём пока подобрал более-менее вменяемый квант IQ4_XS.
После настройки скормил ей простой промпт:
Сгенерируй текст на 1000 токенов и создай с ним страницу HTML
example1.html. Тема текста — AI — это экзокортекс для человека. Оформи красиво в формате Markdown, используй красный, серый, белый и чёрный цвета для форматирования страницы и блоков текста.
Настроена в LM Studio на 64K контекста, при GPU offload 48, с предиктом 4 и включённым offload KV cache на low thinking.
С точки зрения качества генерации текста результат устраивает. С точки зрения скорости модель при текущих настройках даёт 12–14 токенов в секунду, что, конечно, вообще не фонтан. Результат этой тестовой генерации выбросил сюда ТЫК.
TODO
Возьму этот промпт за отправную точку для сравнения скорости и качества текста. Далее после тестов на базовой оркестрации Pi попробую улучшить его с помощью personal context, extensions и skills и повторить тесты. А далее для победителей продумаю другие боевые сценарии и уже попробую по итогу вкрутить их в свой текущий пайплайн.
Есть мысль попробовать более низкий квант Q3, но думаю, результат генерации будет в разы хуже. Если не забуду, напишу тут, что получилось.
to be continued…