Все проекты

Воркфлоу Pi на локальной модели

Расширение Pi: локальная модель делает работу, GPT-5.6 только проверяет план и ревью.

TypeScriptPiAgent workflow
Скриншот терминала PiDev-story
01

Задача

Облачные кодинг-агенты дороги на каждый прогон, а одна локальная модель недостаточно надёжна для правок без присмотра.

02

Что делали

Расширение Pi, где локальный 27B (алиасы FAST/SMART над одной загруженной копией) пишет черновик, реализует и сам себя ревьюит, а GPT-5.6 вызывается только на двух воротах — финализация плана и финальное ревью — и никогда не получает изменяющих инструментов; четыре команды (/deep, /run, /ralph, /web), пакет доказательств с вырезанными секретами для платного ревью и fail-closed лимиты на прогон (запросы, токены, стоимость).

03

Результат

Агентный кодинг через ворота, где платная модель только планирует и ревьюит — большинство токенов крутится локально на нашем кластере — с жёсткими лимитами стоимости на прогон.

Dev-story статья

Воркфлоу Pi на локальной модели: как создавался проект

Облачные кодинг-агенты быстры, но берут плату за каждый токен; полностью локальная модель дёшева, но одна недостаточно надёжна для работы без присмотра. Pi-local — воркфлоу, пытающийся получить оба сразу: дать локальному 27B делать работу, а дорогую облачную модель тратить только там, где она реально меняет результат — на плане и ревью.

Разделы

05

Модули

05

Стек

TypeScript + Pi

01

Почему появился проект

Облачные кодинг-агенты дороги на каждый прогон, а одна локальная модель недостаточно надёжна для правок без присмотра.

Облачные кодинг-агенты быстры, но берут плату за каждый токен; полностью локальная модель дёшева, но одна недостаточно надёжна для работы без присмотра. Pi-local — воркфлоу, пытающийся получить оба сразу: дать локальному 27B делать работу, а дорогую облачную модель тратить только там, где она реально меняет результат — на плане и ревью.

02

Что было создано

Расширение Pi, где локальный 27B (алиасы FAST/SMART над одной загруженной копией) пишет черновик, реализует и сам себя ревьюит, а GPT-5.6 вызывается только на двух воротах — финализация плана и финальное ревью — и никогда не получает изменяющих инструментов; четыре команды (/deep, /run, /ralph, /web), пакет доказательств с вырезанными секретами для платного ревью и fail-closed лимиты на прогон (запросы, токены, стоимость).

Расширение Pi ровно с четырьмя командами (/deep, /run, /ralph, /web). /run ведёт гейтед-конвейер: локальная модель пишет черновик плана, облачная его аудитирует и финализирует, локальная реализует и проверяет, локальная состязательно ревьюит сама себя, запускается опциональная локальная правка, а облачная делает финальное ревью перед APPROVED. Облачная модель только планирует и ревьюит и никогда не получает изменяющих инструментов.

03

Основные модули и путь пользователя

M01

Начали с общего локального рантайма и отказались от него: Thunderbolt-RDMA пара стала единственным локальным исполнителем, так что весь воркфлоу крутится на нашем кластере из двух Mac.

M02

Стоимость fail-closed: жёсткие лимиты на прогон для платных запросов, токенов и долларов, а платный ревьюер стартует с пакета доказательств с вырезанными секретами и без инструментов (может ответить NEEDS_INSPECTION, а не гадать).

M03

Эскалация — страховка: когда локальная модель исчерпывает циклы правок, умная модель завершает прогон, а не выдаёт сломанное — дешёвый путь это дефолт, а не обрыв.

M04

Дисциплина префикс-кэша держит скорость: липкая инъекция навыков на сессию держит префикс-кэш рантайма тёплым, а быстрый и умный роли — алиасы над одной загруженной копией весов, так что смена этапа никогда не перезагружает модель.

M05

Детерминированная карта репозитория ориентирует каждый бриф и вызов инструмента, а живой end-to-end стенд гоняет весь конвейер против реального рантайма, так что ворота тестируются, а не только описаны.

04

Архитектура и технологические решения

Сделано на TypeScript, Pi, Agent workflow.

TypeScript-расширение Pi; четыре команды; локальные быстрый/умный роли берутся из уже загруженного каталога моделей; передовая модель как безынструментный планировщик и ревьюер; герметичные и многораундовые smoke-тесты гейтят go-live.

05

Результат и выводы

Агентный кодинг через ворота, где платная модель только планирует и ревьюит — большинство токенов крутится локально на нашем кластере — с жёсткими лимитами стоимости на прогон.

Агентный кодинг через ворота, где большинство токенов крутится локально на нашем кластере, а платная модель тратится только на планирование и ревью — с жёсткими лимитами стоимости на прогон и эскалацией, чтобы застрявший локальный прогон всё равно чисто завершился, а не падал или тихо стоил состояние.

Читать дальше

Эти проекты близки по техническим или продуктовым решениям и показывают, как тот же принцип работает в другом контексте.

Есть похожая идея?

Обсудить проект