Плагины и скиллы могут ухудшать ИИ? Новые правила работы с сильными моделями
Помогает ли плагин, скилл или инструкция сильной модели — или ограничивает её, и как это измерить, прежде чем строить свою работу с ИИ на чужих надстройках?
Команда claude plugin eval в Claude Code выполняет каждую задачу по три раза с плагином и без него в чистой среде, проверяет ответы, файлы и действия агента шестью типами проверок и выдаёт долю пройденных проверок; читать результат надо через контрольную группу: 70 % без плагина и 90 % с ним — улучшение, 95 % и 95 % — его нет, а 0 % и 95 % чаще значат, что плагин просто открыл доступ к данным. Расширение даёт три вещи — доступ и действия, специальные знания и правила работы, — но в Codex, GPT-6 Astra и Fable задачи без инструкций нередко решаются лучше. OpenAI в материале от 11 сентября назвала проблемы навыков для GPT-6 Astra: длинные пересекающиеся описания, слишком широкие условия активации и пошаговые сценарии, ограничивающие сильную модель, — и предложила короткие описания, подгрузку подробностей по необходимости и пересмотр старых требований. Отчёт «Testing Agent Skills Systematically with Evals» задал четыре критерия оценки навыка, SkillBench на 87 заданиях показал рост успешности с 35 до 50 %, а исследование Agents.md — рост вычислительных расходов больше чем на 20 % без роста успешности. Anthropic делит навыки на компенсирующие недостатки модели, которые отмирают, и фиксирующие рабочие процессы команды, которые живут дольше; интеграции вроде ChatGPT Health и Photoshop у ведущего только мешали. Вывод Александра — работать с передовыми моделями напрямую, а плагины тестировать с пониманием, что они делают.
На что обратить внимание
Ключевые тезисы и выводы
Новая команда прогоняет одни и те же задачи с плагином и без него и отвечает на вопрос, что окупается лучше; в тот же день OpenAI выпустила материал о навыках и инструкциях для GPT-6 Astra.
Каждая задача выполняется по три раза в отдельных сеансах без памяти и настроек; проверяются ответы, файлы и действия агента — совпадение текста, вызов инструмента, порядок вызовов, файлы, оценка моделью, сравнение с эталоном; прогоны расходуют лимиты подписки.
70 % против 90 % — улучшение, 95 % против 95 % — его нет, а 0 % против 95 % обычно означает, что плагин просто открыл доступ к данным вроде Apple Health; для этого и нужна контрольная группа.
Плагин — пакет расширения с навыками, агентами и подключениями, навык — инструкция, а не дообученная модель; но часто лишние инструкции ухудшают результат, и с Fable началась «эра без промптов».
Материал от 11 сентября называет три проблемы — длинные пересекающиеся описания навыков, слишком широкие условия активации и пошаговые сценарии — и предлагает короткие описания, подгрузку подробностей по необходимости и пересмотр старых требований.
Задача, не решавшаяся в разных чатах и в GPT-6 Astra, решилась в старом окне Fable; на вопрос о перезапуске модель ответила «не надо, я всё ужимаю», хотя раньше Opus 4.8 и сам Fable просили перезапуститься.
Независимое исследование на 87 заданиях и 18 конфигурациях показало пользу специализированных навыков, а исследование файлов Agents.md — рост вычислительных расходов больше чем на 20 % без роста успешности.
Anthropic делит навыки на компенсирующие недостатки модели и фиксирующие процессы команды; интеграция ChatGPT Health лезла во все чаты о здоровье, а подключённый Photoshop система открывала вместо того, чтобы сделать самой.
О чём этот выпуск
Соло-выпуск ToTheMoon с Александром Волчеком о плагинах, скиллах и инструкциях — и о том, нужны ли они вообще новым сильным моделям. Интернет пестрит подборками «лучших плагинов» для систем, которые сами работают поверх OpenAI или Anthropic; Александр повторяет свой совет концентрироваться на серьёзных моделях и объясняет, что такое плагин: заранее заданная «комната» из ограничений и инструкций, чтобы модель лучше работала в своей области, — как плагин здоровья в OpenAI, к которому подключается Apple Health.
Первый повод — команда claude plugin eval, которую Anthropic только что добавила в Claude Code. Она выполняет каждую задачу три раза с плагином и три раза без него в чистой среде, оценивает ответы, файлы и действия агента шестью типами проверок — совпадение текста, вызов инструмента, порядок вызовов, наличие файлов, оценка моделью, сравнение с эталоном — и выдаёт долю пройденных проверок. Читать результат надо через контрольную группу: 70 % без плагина и 90 % с ним — улучшение; 95 % и 95 % — его нет, и сравнивать нужно время и стоимость; 0 % и 95 % чаще всего значат, что плагин просто открыл доступ к данным. Плагин и ограничивающая инструкция — не одно и то же: плагин — пакет расширения с навыками, агентами, обработчиками событий и подключениями, навык — инструкция, а не дообученная модель. Расширение даёт три вещи: доступ и действия, специальные знания и готовые решения, правила и порядок работы. Но часто лишние инструкции ухудшают результат: в Codex, GPT-6 Astra и Fable задачи без описания решаются не хуже, а с появлением Fable началась «эра без промптов». Ограничения при этом не всегда недостаток — правило «не отправлять письмо без подтверждения» замедлит систему, но даст контроль.
Второй повод — материал OpenAI от 11 сентября «Переосмотрение навыков и инструкций для GPT-6 Astra»: длинные пересекающиеся описания навыков затрудняют выбор, слишком широкие условия активации грузят лишние инструкции, а пошаговые сценарии, помогавшие прежним моделям, ограничивают более сильную; обязательное чтение большой документации перед каждым изменением расходует контекст и время. OpenAI предлагает короткое описание назначения, подгрузку подробностей по необходимости и регулярный пересмотр старых требований, а также напоминает, что одну инструкцию разные модели понимают по-разному, — Александр видит в этом столкновение Codex и Claude в своих проектах и делится наблюдением из Fable, где старую задачу он решил в контекстном окне, которому больше месяца, а модель отказалась перезапускаться. Дальше — отчёт OpenAI «Testing Agent Skills Systematically with Evals» с четырьмя сторонами оценки навыка, исследование SkillBench на 87 заданиях с ростом успешности с 35 до 50 %, исследование Agents.md с ростом расходов больше чем на 20 % без роста успешности и классификация Anthropic: навыки, компенсирующие недостатки модели, отмирают, навыки, фиксирующие процессы команды, живут дольше. Собственный опыт ведущего — интеграция ChatGPT Health, которая лезла во все чаты о здоровье, и Photoshop, который система пыталась открыть вместо того, чтобы сделать самой, — иллюстрирует вывод: работать с передовыми моделями напрямую, в ChatGPT, Codex и Claude Code, а плагины тестировать с пониманием, что это такое.
Ценность выпуска в том, что спор «нужны ли плагины» переведён из вкусового в измеримый: у Anthropic теперь есть инструмент сравнения с плагином и без него, у OpenAI — инженерные наблюдения о том, что старые навыки ограничивают новую модель, а у независимых тестов — цифры в обе стороны. Ведущий не отрицает пользу расширений там, где они дают доступ к данным или закрепляют процессы команды, но настаивает, что понимание моделей приходит только из прямой работы с ними. Практический вывод: прежде чем подключать чужую надстройку, проверить, что она даёт именно новую возможность, а не лишний контекст.
Расшифровка выпуска
Голосовая связка применена к 61 сегментам: 61 определено, 0 содержат несколько определённых участников, 0 вероятных, 0 остаются без окончательной идентификации. Неподтверждённые голоса обозначены как «Участник дискуссии», фрагменты с несколькими подтверждёнными участниками — как «Микс».
Читать транскрипт на отдельной странице
Загрузка…