13 сентября 2026 г. · 2 min

Тест локальной модели Qwen 3.8 27B через Pi.dev

Первый замер локальной модели в Pi.dev: качество текста устраивает, а скорость на текущих настройках составляет 12–14 токенов в секунду.

В тему harness и поисков экономии токенов для вайб-кодинга, делегирования рабочих задач и т.п. дошли руки до тестов локальных моделей на моём ПК через pi.dev. Базовая оркестрация настроена пока плохо: я привык к OpenClaw, а разобраться с настройками настолько глубоко пока не нахожу времени.

Идея в том, чтобы получить сабагента с более-менее вменяемым количеством параметров и не на супернизком кванте, который помогал бы экономить токены и закрывать несложные задачи.

Конфигурация

  • RTX 5070 Ti 16 GB
  • Ryzen 9800X3D
  • 64 GB RAM

Модель — Qwen3.8 27B. Опытным путём пока подобрал более-менее вменяемый квант IQ4_XS.

После настройки скормил ей простой промпт:

Сгенерируй текст на 1000 токенов и создай с ним страницу HTML example1.html. Тема текста — AI — это экзокортекс для человека. Оформи красиво в формате Markdown, используй красный, серый, белый и чёрный цвета для форматирования страницы и блоков текста.

Настроена в LM Studio на 64K контекста, при GPU offload 48, с предиктом 4 и включённым offload KV cache на low thinking.

С точки зрения качества генерации текста результат устраивает. С точки зрения скорости модель при текущих настройках даёт 12–14 токенов в секунду, что, конечно, вообще не фонтан. Результат этой тестовой генерации выбросил сюда ТЫК.

TODO

Возьму этот промпт за отправную точку для сравнения скорости и качества текста. Далее после тестов на базовой оркестрации Pi попробую улучшить его с помощью personal context, extensions и skills и повторить тесты. А далее для победителей продумаю другие боевые сценарии и уже попробую по итогу вкрутить их в свой текущий пайплайн.

Есть мысль попробовать более низкий квант Q3, но думаю, результат генерации будет в разы хуже. Если не забуду, напишу тут, что получилось.

to be continued…