К содержанию
Транскрипт

Транскрипт · 167 · Плагины и скиллы могут ухудшать ИИ? Новые правила работы с сильными моделями — ToTheMoon

Полная расшифровка. Таймкоды открывают соответствующий момент видео.

К странице выпуска
00:00:00–00:03:31Плагины и skills: нужны ли они новым сильным моделям?
Александр Волчек00:00:08

У нас сегодня очень интересная тема, потому что я вижу, как интернет невероятно сильно пестрит, вот если взять там вторичный или третий или четвертый рынок, не брать OpenAI только и Anthropic или Google, а когда огромное количество других стартапов, компаний или людей, которые хотят на этом заработать деньги, просто невероятно пестрят заголовками там 15 лучших плагинов в этой системе, там, 20% лучших плагинов вот для этой системы, а эта система работает еще на какой-то системе, а эта система работает на базе, например, OpenAI или на базе Anthropic. И вы все знаете, что я неоднократно это доносил, я всем предлагаю при изучении искусственного интеллекта максимально концентрировать свое внимание на серьезных компаниях и серьезных моделях.

Упоминаются: OpenAI · Плагины и навыки ИИ
Александр Волчек00:01:04

Если еще два с половиной года назад можно было там делать тесты и в ChatGPT, и в Claude, и в DeepSeek, даже, наверное, в Gemini, то на сегодняшний момент надо очень четко сконцентрировать себя. Если вы можете одну модель использовать, но используясь одну, там, ChatGPT или Claude, кому нравится, да. Если вы разрабатываете софт, там еще можно выбрать Claude или Codex. Если вы шире, но можете использовать две модели, можете выбрать какие-то другие модели. Или все-таки использовать разные прослойки, такие, например, как Perplexity или такие, там, Hermes и очень много всего остального.

Упоминаются: ChatGPT · Claude
Александр Волчек00:01:48

Я ни в коем случае не ухожу, что у них у многих свои собственные решения, свои собственные агентские системы есть. Или использовать, например, плагины различные внутри этих систем, как вот есть плагин для работы со здоровьем, ChatGPT Health. Или, например, сейчас интересных вышло два обновления, я думаю, что я про этот выпуск сделаю, про финансовые, отдельные финансовые системы, там, в OpenAI и в Claude. Вот эти плагины, которые они делают разные, там, огромное количество, да, если посмотреть в библиотеке плагинов в OpenAI или в библиотеке плагинов в Claude, они, ну, действительно очень большие, помогают при работе с файлами, с таблицами, с поиском, дают возможность целенаправленно что-то изучать, здоровье или питание, фитнес, там, финансы, образование.

Упоминаются: Плагины и навыки ИИ · OpenAI · Claude
Александр Волчек00:02:46

Что такое плагин, если кратко сказать? Это когда есть некоторая заранее предопределенная комната, да, или какие-то ограничения, или инструкции дополнительные, для того, чтобы ваша система лучше выполняла задачи в этой тематике. То есть, если мы возьмем пример плагина в OpenAI Health, то, по сути, это плагин, к которому вы можете подключить независимые системы вашего здоровья, с теми, с которыми он интегрируется, ну, в частности, к нему можете подключить Apple Health, да, и он, отвечая на ваши вопросы, будет использовать свою базу знаний, которая касается здоровья, то есть те инструкции, которые у него есть в здоровье.

Александр Волчек00:03:30

И вот смотрите, стоит вопрос, сегодня очень интересный выпуск, потому что Claude буквально несколько дней назад сделал новую функцию в Claude Code, которая, по сути, он сделал новую команду, которая называется claude plugin eval.

Упоминаются: Claude
00:03:31–00:08:33Новая команда в Claude Code: claude plugin eval
Александр Волчек00:03:51

И у нее уже есть апдейт, эта функция существовала, у нее уже есть апдейт, как бы апдейт версии, и, по сути, это инструмент тестирования, который отвечает на этот поставленный вопрос. И на какой вопрос? А что выгоднее? Использовать плагин для решения определенной задачи, например, в финансах вызвать плагин финансовый, или в написании кода вызвать какой-то определенный плагин по коду, или в прокладывании маршрута туристического, или каких-то идей по путешествиям вызвать плагин, или не использовать плагин.

Упоминаются: Плагины и навыки ИИ
Александр Волчек00:04:28

То есть вот новая функция, мы сейчас с вами, я вам отдельно расскажу про Claude, и отдельно расскажу про OpenAI, очень-очень такую важную структурную информацию, потому что OpenAI выпустила, мне кажется, я сейчас дату вам точно скажу, OpenAI выпустила буквально несколько дней назад. Также, кстати, у них примерно в один день, кстати, это было, я вижу, у них вызвался, выпустился отчет, который называется «Пересмысление навыков и инструкций для GPT-6 Astra», и он как раз-таки очень интересен с пониманием плагинов.

Александр Волчек00:05:05

И вот если вы посмотрите весь рынок, что все пишут? Там 20 кейсов, которые вы должны сделать на GPT-Astra, там эти вещи вы должны включить в GPT-Astra, там эти вещи включить в GPT-Astra. Опять люди начинают указывать на какие-то конкретные инструкции. А я, как вы знаете, инструкции, разные вот эти ограничения, которые все хотят создать, вокруг не очень сильно люблю. И в моей концепции, в моей парадигме, у нас скоро будет очень интересный выпуск о главных вообще фишках современного тренда искусственного интеллекта.

Упоминаются: Astra · Промпт-инжиниринг
Александр Волчек00:05:39

Я призываю всех использовать модели в рамках ежедневного дня в понимании того, что поиска в привычном виде не будет, большинство приложений и программного обеспечения в привычном виде не будет, изменится огромное количество происходящих процессов, которые сейчас есть, изменится огромное количество компаний, процессов этих компаний. То есть рынок подлежит в ближайшие годы существенным изменениям. То, что я сейчас говорю, это неплохо. Это не хорошо и не плохо. Есть некоторая данность понимания, и с ней спорить бессмысленно.

Александр Волчек00:06:15

Как спорить с тем, что люди продолжат использовать Google поиск как раньше. Его уже не используют как раньше. Там уже как минимум есть сверху очень быстрый AI-ный ответ. Мы как раз недавно в выпуске с Ильнаром эту тему очень серьезно рассуждали. Так вот, если говорить про эту функцию claude plugin eval, то что там происходит? Там происходит, по сути, повторное выполнение. То есть для выбора нового плагина вы выбираете плагин, и для него, смотрите, если вы не используете Claude, это ничего страшного, вы должны это понять на базе, как это работает, в том числе, до OpenAI, или если вы пользуетесь Gemini, или если вы пользуетесь DeepSeek, чем мы его не использовали вообще.

Упоминаются: Claude · OpenAI · Плагины и навыки ИИ
Александр Волчек00:06:55

То это вам поможет в понимании вообще, что такое эти плагины дополнительные. А еще лучше это будет вам в понимании прослоек и прокладок разных систем. Еще раз, я вообще это категорически не поддерживаю разные прослойки, поддерживаю именно их в сложных, сугубо очень сложных кейсах. Вот эти прослойки, которые делают люди там. Прослойка для того, чтобы легко создать мобильное приложение, прослойка для того, чтобы в CMS-системе быстро делать какие-то страницы, прослойка для написания текста, прослойка для создания правильного стори-тейлинга, прослойка для создания, написания, обработки YouTube-видео.

Упоминаются: Плагины и навыки ИИ
Александр Волчек00:07:33

На сегодняшний день вы просто, используя эти софты, где-то, конечно, ну как бы по привычке автоматом что-то работает, вы очень часто, это не значит, что надо от всех таких вещей отказаться, но вы очень часто упускаете совершенно новые возможности, которые уже появились. То, что может сейчас сделать Claude Code Fable или GPT-6 Astra, ну это нереальные вещи с точки зрения верстки или разработки сайтов, создания структуры и стратегии презентации. То есть это как бы новые, новые вообще парадигмы всего происходящего, создания там аналитических разных отчетов.

Упоминаются: Astra
Александр Волчек00:08:09

Эти прослойки, они и плагины, эти системы, кстати, это будут поддерживать. То есть Anthropic или Claude Code, они будут продолжать создавать плагины для специализированных систем, не знаю, как это, для Power BI, то есть они будут продолжать это делать, потому что это их корпоративный клиент или корпоративный заказчик. Итак, что делает вот этот claude plugin eval? Он делает повторное выполнение. Что это значит? То есть по умолчанию каждое задание выполняется трижды с плагином и трижды без него.

Упоминаются: Плагины и навыки ИИ · Claude
00:08:33–00:09:44Как Anthropic предлагает проверять пользу плагинов
Александр Волчек00:08:39

Очень интересно, да? Мы сейчас поговорим вообще по поводу повторного выполнения разных заданий. Чистая среда, есть такое понятие, это отдельные сеансы без вашей памяти, других плагинов или плагинов и обычных пользовательских настроек. Дальше, значит, что происходит? Происходит проверка, оцениваются различные ответы, созданные файлы и действия агента вот в этих, по сути, шести сессиях. И присваивается итоговый балл, то есть доля пройденных проверок с учетом весов, усредненная по запускам.

Упоминаются: Плагины и навыки ИИ
Александр Волчек00:09:13

Значит, там есть внутри у них разные команды, мы сейчас поговорим, там есть сравнение, по сути, можно посмотреть с плагином, без него там, или разница, которая существует. И запуски, оценки моделью расходуют лимиты подписки. Соответственно, вы должны понимать, что у каждого этого запуска могут быть разные расходы, и они расходуют ваши лимиты внутри подписок. Подписки, ну, либо вы оплачиваете через API, через программный интерфейс. Значит, есть шесть типов проверки.

00:09:44–00:11:066 критериев проверки Ai-агента с плагинами
Александр Волчек00:09:46

Есть такое понятие, как совпадение текста, есть там вызов инструмента, есть проверка порядка вызовов, наличие файлов и так далее. Ну, там есть оценка моделью и сравнение с эталоном. Просто это вы можете с точки зрения вот этого технического способа. Я вам сейчас расскажу про технический способ. Я не призываю вас еще раз всех этих технических способов запускать. Это интересно людям, которые глубоко готовы погружаться. Те, кто погрузились, пожалуйста, напишите, на чем вы тесты делали, в чем разница была.

Александр Волчек00:10:18

Очень важно это на канале узнать и увидеть. И другим людям важно увидеть. И мне тоже очень интересно. Ну, и не забывайте поддерживать наш канал To The Moon. Ваш лайк, подписка, комментарий, простое действие. Это очень сильно улучшает наше движение, наше развитие у нас в канале. Но вот эти типы проверки, они тоже интересны, потому что мы должны с вами понимать, а вообще, что мы проверяем. Потому что это такая непростая история. Как мы вообще вывод будем оценивать, особенно если в плагине достаточно непростой вопрос задан.

Александр Волчек00:10:48

Значит, вы, соответственно, подготовили там внутри к запуску полностью все, что у вас произошло. Нас сделали вот эти полностью все настройки. У вас, по сути, появляется в конце вот этот вот результат. Значит, там есть некоторый расчетный бюджет у вас, может быть. Вы запустили, вот у вас есть результат. Как понимать результат?

00:11:06–00:15:59Как проверяет рабочий плагин или нет
Александр Волчек00:11:07

Значит, допустим, что на одинаковых заданиях получилось, ну, какая-то, например, следующий вам пример. Опять же, я вам приведу какие-то условные цифры, нереальные измерения. Например, у вас получилось, что без плагина 70% с плагином 90%. Это значит, что есть заметное улучшение по выбранным критериям. То есть 70 и 90. Если у вас результат получился без плагина 95% с плагином 95%, то улучшение качества вообще не показано. И нужно сравнивать, например, какое было время потрачено на эти задачи, какая была стоимость внутри находилась.

Упоминаются: Плагины и навыки ИИ
Александр Волчек00:11:38

Если, например, результат там без плагина 95%, 80% с плагином, здесь надо смотреть, что, возможно, плагин мешает, либо какой-то тест настроен, например, не сильно правильно. А если у вас ситуация, что без плагина 0%, а с плагином, например, 95%, что нужно вообще разобраться. Вот смотрите, когда такие отличия очень сильные, да, то нужно разобраться, плагин дал новую возможность или просто открыл доступ, например, к необходимым данным. Например, вы попросили проанализировать, что у вас происходило целый месяц с количеством шагов, которые проходят каждый день, и в плагине у вас есть доступ к Apple Health, который собирает количество шагов, которые проходят.

Упоминаются: Плагины и навыки ИИ
Александр Волчек00:12:17

А без плагина он не знал. Ну, понятно, что результат будет без плагина 0%, с плагином 95%. Я думаю, что всем здесь понятно, да. Потому что с плагином все получилось, еще не означает, получилось благодаря плагину. Именно для этого и нужна вот эта контрольная группа, которая есть без него. Значит, важно понимать, что плагин и ограничивающая инструкция – это не одно и то же, да, потому что в интернете мы все с вами видели, и на заре, вспомните, там 3-2 года назад огромное количество людей говорило, вот возьмите эту инструкцию, возьмите эти промпты, значит, вам это сверх поможет.

Александр Волчек00:12:49

Важно понять, что плагин и инструкция – это не одно и то же. Просто, например, в Claude Code плагин – это пакет расширения. Он может содержать навыки, он может содержать дополнительных агентов, обработчики различных событий, он может содержать подключение к внешним системам, как в моем примере, с подключения к Apple Health. Навык или скилл – это прежде всего, когда мы знаем, это инструкция, иногда она может быть с какими-то примерами, она может быть с файлами, там, готовыми даже программами.

Александр Волчек00:13:19

Это не специально дообученная модель, да. Поэтому я бы разделял пользу в данном случае на разные ситуации. И мы сейчас еще раз с вами, я вам сказал, что мы сейчас перейдем к OpenAI. И здесь фундаментальная вещь, ну, наверное, две фундаментальные вещи вам хочу донести про GPT-6 Astra и вообще про планете плагинов и инструкций, да. Значит, что добавляет расширение? Добавляет доступ и различные действия, то есть, например, получение документов из корпоративной системы дополняет вам, например, изменение записи, запуск специализированного инструмента, например, которого есть.

Александр Волчек00:14:01

И понятно, что здесь есть конкретная польза, потому что модель получает возможность, которую иначе у нее никаким образом не было. И вот сейчас, если мы с вами посмотрим на вот эти дополнительные плагины и даже где-то системы, вот есть же отдельные настройки огромные в образовании или в безопасности, там, в кибербезопасности OpenAI. Вот эти настройки и плагины, они, конечно, могут подключаться, вот финансовые системы, они там подключаются прямо к институциональным данным, например, к ежедневным каким-то аналитическим отчетам, сводкам, к платным различным системам и так далее, да.

Упоминаются: OpenAI · Плагины и навыки ИИ
Александр Волчек00:14:45

Понятно, что вы свою систему вроде как тоже можете сами подключить к этим данным отдельно, потом и настройки. Сейчас мы про это, про это обязательно, я про это скажу. Но важно, плагин может иметь вот этот доступ и действие к системам. Дальше, что добавляет вот эти, ну, что добавляет это расширение? Добавляет специальные знания и готовые решения. То есть, например, особенности внутренней системы, проверенный способ обработки, там, например, какого-то нестандартного файла, то есть, например, какой-нибудь плагин для работы с какими-то специализированными форматами аудио, да, он вам будет открывать эти файлы дополнительные, или плагин, который работает для какой-то суперкрутой архивации.

Упоминаются: Плагины и навыки ИИ
Александр Волчек00:15:22

И здесь польза в том, что не приходится вам заново искать или изобретать какие-то решения, или описывать, как это должно работать. То есть, система базово очень сильно на это настроена и понимает, что это такое, и работает конкретно в этом месте, да. И расширение добавляет вам третью историю, добавляет правила и порядок работы. То есть, какой-то шаблон отчета там может содержаться, последовательность конкретных действий или проверок, которые система должна будет делать, например, обязательное согласование, которое она должна с вами делать, или внутри себя с точки зрения своей агентской системы.

Александр Волчек00:15:54

То есть, результат, по сути, соответствует вашим требованиям, да. Здесь очень важно, вот у меня какая возникает конструкция, что часто вот эти дополнительные инструкции, они могут приводить к тому, что ухудшать результат.

Упоминаются: Промпт-инжиниринг
00:15:59–00:18:44Лишние инструкции ухудшают результат
Александр Волчек00:16:10

То есть, возможно, если инструкции не давать, то результат будет лучше. И вы можете посмотреть вот в Codex, в GPT-6 Astra и в Fable большое количество задач без описания. Вот я помню, когда Fable появился, это очень четко было видно. Ты начал меньше писать промпты, и пошла вот эта эра отсутствия промптов. И это, смотрите, будет только продолжаться. Хуже не станет. И думать, что кто-то может лучше настроить где-то уникально как-то систему, и вам какую-то фишечку передать, это такая определенная абстракция.

Упоминаются: Промпт-инжиниринг · Astra
Александр Волчек00:16:45

То есть, ваша задача научиться понимать вообще, как эти системы работают, и как это применять в рамках вашего ежедневного дня. Но важная история, что ограничения не всегда являются недостатком. Здесь разделяется. Я не сверхлюбитель плагинов. Сказал бы, вообще стараюсь это категорически не использовать. Я вижу в них проблемы. Но все же есть другая сторона, я хочу ее посвятить. Многие из вас увидят в этом полезность. Многие из вас уже мне предлагали скиллы, навыки, куча всего.

Упоминаются: Плагины и навыки ИИ
Александр Волчек00:17:14

Понятно, что много. У меня как-то открыл Codex, он мне говорит, значит, у вас там что-то 100, 40, ну или какое-то количество скиллов. Я думаю, о, отлично, значит, я не уверен, значит, что я эти скиллы создавал. Вот у меня написано сейчас, что я использовал 1319 скиллов. Ну, окей. То есть, и исследовал какие-то еще 23 скилла. Ну, значит, система сама что-то создает, сама делает эти скиллы, сама описывает в рамках моих проектов. То есть, она это делает для себя. Но это не я, значит, который сказал, создай, пожалуйста, скиллы, опиши.

Упоминаются: Плагины и навыки ИИ
Александр Волчек00:17:51

Такое было несколько раз. И я хочу сказать, что у меня еще потом проблемы с этими случаются. И я до конца для себя не понял, надо ли создавать вот эти именно скиллы AI. Об этом мы сейчас поговорим. Или нужны очень четко, жестко описанные критерии. Значит, еще раз, ограничение вот этим плагином, оно не всегда недостаток. И все же, да, мы можем понимать, что, например, если есть ограничение не отправлять письмо без подтверждения, в каком-то плагине написано, то оно, например, замедлит работу вашей системы, в отличие от того, что вы скажете, напишите письмо, оно возьмут ее и отправят сразу же, да.

Упоминаются: Плагины и навыки ИИ
Александр Волчек00:18:31

Но, по крайней мере, у вас будет обеспечен очень сильный контроль, потому что существует вот такое вот жесткое требование. И еще раз, во многих организациях, компаниях, процессах, это вам важно.

00:18:44–00:21:44Плагины и skills: нужны или нет. Что рекомендует OpenAI
Александр Волчек00:18:44

Значит, теперь перейдем к OpenAI и к GPT-6 Astra для понимания этого кейса. То есть у нас с вами вопрос, который есть, а плагины вообще нужны или не нужны? Или они все же не нужны? И не надо использовать эти прослойки, не надо делать вообще вот это, не надо. Не надо, значит, заходить и в Notion продолжать, значит, для обработки короткой таблички использовать искусственный, например, интеллект внутри него. Не надо внутри ChatGPT вызывать Notion для вашей, там, если это небольшой какой-то проект, небольшая табличка.

Упоминаются: OpenAI · Astra · Плагины и навыки ИИ · Notion · ChatGPT
Александр Волчек00:19:17

Или не надо ниже спускаться еще в плагин не Notion, а в плагин для организации работы тасков какой-то. Да, таких плагинов существует, очевидно. А вообще убрать это и сказать, что, значит, я живу своей жизнью. Вот вам пример приведу, как я сейчас товарищ прилетел из Италии, там, и друг мой, и партнер, и он фотографирует везде еду. И говорит, ну, я для себя решил, что это самый простой способ. А я ему сказал, так это самый крутой способ. Он говорит, слушай, ну, существуют разные системы, там, и плагины какие-то отдельные решения программные, которые вот системы эти обученные, они могут помогать мне чуть больше с точки зрения питания по еде.

Упоминаются: Notion · Плагины и навыки ИИ
Александр Волчек00:19:54

А я ему сказал, нет ничего лучше на сегодняшний день, нет ничего лучше вообще. Решение, чтобы просто фотографировать свою еду постоянно с точки зрения того, что ты ешь, в обычный чат, в ChatGPT 5, ну, или в Codex, там, если вы с ним связаны, конечно, ChatGPT 5 достаточно. Потому что ChatGPT 5 позволит вам дать гораздо больше всего. Он позволит обратиться ни к одной базе данных систем, ни к двум, ни к трем, ни к четырем, а к ста, к двумстам, к разным странам, или к разным врачам, или к кому вы захотите.

Александр Волчек00:20:25

И он будет эту информацию иметь в... Вы можете фотографировать как угодно, вы можете взвешивать, вы можете не взвешивать, вы можете сфотографировать в меню, вы можете наговорить голосом, вы можете абсолютно по-разному, значит, работать с этой информацией. Мало того, у моего партнера у него Pro-версия, и ни одна внешняя система никогда в жизни не запустит оценку вашей еды через GPT-6 Astra Pro. Никогда, вот поверьте, она это делать не будет. Потому что слишком дорогие запросы будут для обработки, постоянной, например, обработки, если вы будете еще говорить, перечитывая, значит, весь контекст, и два года мне смотреть, что я тут два года ел, значит.

Упоминаются: Astra
Александр Волчек00:21:05

А мало того, вы можете туда в чат загнать еще какие-то выписки врачей, какие-то результаты анализов, а другие системы просто будут в этом ограничены. Кто-то, опять же, вы сейчас можете перевести, что это не так, что такие системы выживут, такие системы не выживут. Ну, это мое всего лишь заключение. Значит, OpenAI. Это, кстати, хороший пример использования и не использования плагинов. Не рекомендую использовать плагины в такой системе. Это моя личная сугубо рекомендация. Я лично бы себе не рекомендовал это делать, так не буду.

Упоминаются: OpenAI · Плагины и навыки ИИ
Александр Волчек00:21:34

И моему приятелю сказал, что на самом деле ты выбрал самый крутой путь, а не ограниченный путь. Значит, в OpenAI 11 сентября выпустил материал, который называется «Переосмотрение навыков и инструкции для GPT-6 Astra».

00:21:44–00:25:52OpenAI: инструкции ограничивают ChatGPT Astra
Александр Волчек00:21:49

И они описывают несколько проблем. Первая проблема звучит следующим образом, что длинные пересекающиеся описания навыков затрудняют выбор нужного. И слишком широкие условия активации, условные инструкции, вот эти, которые есть со стороны, заставляют загружать инструкции, не относящиеся к задаче. И, по сути, подробные пошаговые сценарии, которые помогали предыдущим моделям, могут чрезмерно ограничивать более сильную модель. И Ильнар рассказывал про это, про Astra, что Astra работает по-другому.

Александр Волчек00:22:21

То есть мы должны с вами понять, что мы в новой эре находимся и в новом веке находимся. И нам надо начать, вот даже вам всем сегодняшнего выпуска, смотреть на это совершенно по-другому. Еще раз услышьте, что подробные пошаговые сценарии, которые помогали предыдущим моделям, могут ограничивать более сильную модель. Обязательное чтение большой документации перед каждым небольшим изменением расходует контекст и время. И, кстати, я хочу сказать, что я что заметил вам в Fable. Интересно, кстати, опять же, кто здесь много проектирует, я заметил в Fable такую историю, что мне уже стало невыгодно открывать каждый раз новый чат при проектировании систем.

Александр Волчек00:23:05

У меня много там систем идет. И мне выгоднее в одном чате все разрабатывать. И я недавно, кстати, у Fable в очень длинном контекстном окне спросил очень длинные задачи, длиться, мне кажется, месяца полтора в одном чате. Сколько раз я пытался эту задачу решить другими разными чатами? Она не решалась. И, кстати, я о ней рассказывал, помните, несколько выпусков назад, что у меня есть задача, которая не решается. GPT-6 Astra опять ее не решила. Там та-та-та-та-та. Я ее решил наконец-то.

Упоминаются: Astra
Александр Волчек00:23:31

Вчера вечером я, значит, ее решил. Все, задача решена. Так вот, задача эта была решена вот в этом старом контекстном окне. Мне кажется, ему больше, чем месяц-полтора-два. Я у Fable там спросил как раз-таки несколько дней назад, когда вот после GPT-6 Astra у нее не получилось, я перешел. Может быть, надо новое контекстное окно запустить? На что мне Fable скажет, нет, не надо. Я здесь все ужимаю, мне все понятно. Раньше даже сам Fable говорил о том, что действительно, сейчас мы перенасыщенные, перезапуститесь.

Упоминаются: Astra
Александр Волчек00:24:02

Ну, Opus 4.8 точно про это говорил. Но Fable тоже, я помню, в какой-то момент времени он так говорил. Сейчас он продолжит там внутри работать и он разрешил мне задачу по-настоящему. Прямо ее довел до конца, мне это очень понравилось. И я даже вижу, что в Codex у меня висит там большое количество чатов, там даже в них, потому что они там облачные, в них недоступны сейчас GPT-6 Astra Extra High или Ultra, а доступен 5.6 Sol Extra High. Наверное, из-за того, что они у меня работают как бы с другого Codex, с другого компьютера, там именно часть задач, которые постоянно я использую, я их конкретно использую, потому что открытие любой новой задачи вызывает какой-то, ну, какой-то парадокс просто у системы каждый раз, а не ты просто внутри развиваешься в системе.

Упоминаются: Astra
Александр Волчек00:24:48

Мне это очень нравится. То есть я очень хочу, чтобы мы пришли в разработке систем, когда, например, разрабатывать какую-то систему или управляете компанией, и вы можете, по сути, управлять через одно окно этой компании. Понятно, что это одно окно, наверное, в какой-то момент времени не должно быть представлено как некоторый один чат. То есть это какой-то должен быть, какой-то попадет специализированный интерфейс, мы посмотрим, как это будет выглядеть. Чья-то подобный интерфейс, да, в котором могут что-то всплывать, открываться, где-то какие-то быть детали.

Александр Волчек00:25:15

Эти все системы пробуют это найти, как в частности, как в коде такие создаются там список задач, которые должны выпустить, как Codex это делает с точки зрения шагов. Он пишет там, сколько шагов у него есть, какие он там планы поставил, какие он цели поставил, да. Вспомните, в 5.6 Sol это появилось. И это очень интересная вещь. Вот эта тема, то, что обязательное чтение небольшой документации перед каждым небольшим изменением расхода контекста и время, она, конечно, невероятно фундаментальная, важная, нужная вам для осознания, да.

Александр Волчек00:25:47

И еще раз услышьте ее, пожалуйста, значит. И что предлагает OpenAI?

Упоминаются: OpenAI
00:25:52–00:27:16Эффективные инструкции для GPT-6 Astra
Александр Волчек00:25:52

Они предлагают подход, значит, короткое описание назначения, загрузка подробностей только при необходимости и регулярный пересмотр старых требований. То есть важно также учитывать, что, кстати, что одну инструкцию могут использовать разные модели. То есть полезная для одной, не обязательно полезная для другой. И вот в этом, кстати, я вижу очень большую проблему столкновения Codex и Claude, когда Fable что-то делает, и он вроде говорит, классно, и тут, значит, GPT-6 Astra, и она как бы выдает, что там что-то не то.

Упоминаются: Промпт-инжиниринг · Astra · Claude
Александр Волчек00:26:31

И у них вот эти разные, потому что там есть еще инструкция, она не все проанализировала, проанализировала какую-то часть, и ты, значит, сидишь и думаешь, так, и как им вместе с она строится, да. И это непростая история. И вот важно учитывать вот эту вот историю по поводу, что разные модели понимают по-разному инструкцию, разные системы искусственного интеллекта понимают по-разному инструкцию, и тоже самое, как разные люди, да, по-разному относятся к, вроде бы, казалось одним и тем же вещам.

Упоминаются: Промпт-инжиниринг
Александр Волчек00:26:59

И, кстати, то, что я сейчас рассказываю, это официальные инженерные наблюдения OpenAI, важно, да, а не то, что там было какое-то исследование, которое, не знаю, какой-то универсальный процент ухудшения давало. В OpenAI была такая еще история, что в начале года они выпускали такой отчет, который называлось «Систематическое тестирование навыков агента», да, «Testing Agent Skills Systematically with Evals».

Упоминаются: OpenAI · Плагины и навыки ИИ
00:27:16–00:29:01Skills для новых моделей: подход OpenAI, тесты и что останется полезным
Александр Волчек00:27:30

И там предлагалось оценивать не убедительность ответа, а четыре стороны работы, то есть достигнут ли результат, выполнены ли необходимые действия, соблюдены ли требования к оформлению, там, того, задачи, и сколько было потрачено ресурсов внутри. И вот для первого набора там достаточно было, там, 10-20 целевых запросов, включая те, на которые навык не должен включаться. И там была такая история, когда был запуск Codex с сохранением структурированного журнала действий, затем программные проверки анализировали там файл, команды, и отдельная оценка модели проверяла более субъективные требования.

Упоминаются: Плагины и навыки ИИ
Александр Волчек00:28:08

Значит, также там предлагалось отслеживать расход токенов, и, по сути, это практическая методика построения проверок, а не обещание, например, того, что навык был полезен. То есть то, что я сейчас рассказываю, почему вспомнил этот кейс, это история не… был кейс, кстати, еще с GPT 5.4, там эксперимент с лишним контекстом был, и загружались, типа, например, все описания сразу, либо находились там нужные по запросу, да, внутри, например, когда вы по здоровью говорите там какую-то историю, там, и даете вот этот большой контекст, или я, например, говорю, постоянно загружаю, не знаю, весь выпуск ToTheMoon, представим себе все расшифровки, или загружаю там, книги какие-то все сразу, да, или по чуть-чуть идет.

Александр Волчек00:28:53

И там тоже система это измеряла. Но это все старая система, я просто говорю, что задача не новая. И было исследование независимое у SkillBench, делали его летом на 87 заданиях и 18 конфигураций моделей агентов с подготовленными разными навыками.

Упоминаются: Плагины и навыки ИИ
00:29:01–00:30:35SkillBench: помогают ли навыки
Александр Волчек00:29:14

И вот эти подготовленные навыки, они подняли успешность с 35% до 50%, условно там 15% было. То есть у них была такая история, что специализированные навыки действительно во многих случаях помогали, существенно помогали, кстати, улучшать все остальное, да. И особенно какие-то наборы, например, эффективность помогали делать. И я хочу сказать, что... А было, кстати, исследование в файлах Agents.md, это файлов, условно, агентских для создания каких-то систем, вот был вывод следующий результат, что файлы и инструкции для работы с репозиториями в целом не улучшали успешность, но увеличивали вычислительные расходы в целом больше, чем на 20%.

Александр Волчек00:30:05

Это, кстати, обратите внимание, тема офигеть, потому что все системы говорили, что надо, значит, вот эти Agents.md обучать, как работать, нагружать их полностью, все, да. И получилось, что само, как это можно, как вы можете это понимать, что само добавление описаний проекта и требований не гарантировало улучшения, да. Хотя, еще раз, авторы при этом признавали пользу таких файлов для нестандартных правил разработки. Это всего лишь вам некоторые детали.

00:30:35–00:32:53Когда skill становится лишним, а когда полезным
Александр Волчек00:30:36

Здесь история такая, что Anthropic сама приводит информацию о том, когда навык становится ненужным. Первый тип этого – это навыки, компенсирующие недостатки возможности модели. Например, какая-то особая техника создания документов по мере улучшения модели, они, по сути, становятся ненужными. И мы все с вами знали об этом, что раньше, например, выпускали какие-то плагины, которые лучше дорабатывали текст, потому что модель это сделать не могла, например, да. И сейчас модель это может делаться, зачем использовать эти сторонние системы.

Упоминаются: Плагины и навыки ИИ
Александр Волчек00:31:07

И это про то, что я везде повторяю, очень много про это говорю. Модели в любом случае невероятно сильно будут развиваться. У них даже если сегодня какая-то фишка не работает, она в какой-то момент начнет работать. Я помню, было время, когда невозможно было архив загрузить, он не анализировался, или какие-то большие документы не анализировались. Сейчас все это становится, по сути, такой очень относительной проблемой. И второй тип, который Anthropic выделяет, это навыки, фиксирующие ваше предпочтение и рабочие процессы.

Упоминаются: Плагины и навыки ИИ
Александр Волчек00:31:36

То есть модель может прекрасно уметь выполнять каждый шаг, но не знать, какой порядок, формат, критерии нужны именно вашей команде. И, соответственно, такие навыки могут оставаться полезными дольше. И вы здесь должны понимать, что если у вас есть какие-то фундаментальные внутренние свои собственные вещи, и вы запустили плагин, который работает со стороны, вы не до конца понимаете, как он работает, у него есть сторонние инструкции, то он вам скорее принесет вред, чем пользу. Вот мне так принес вред ChatGPT Health интеграция.

Александр Волчек00:32:08

Очень странная конструкция. Мало того, она постоянно, когда я начал задавать потом в других чатах вопросы по здоровью, она постоянно пыталась этот плагин загрузить. Пока я его не вырубил. Кстати, сейчас вышло в ChatGPT Health новое обновление, и настройка вот эта грузить и не грузить плагина, она как бы по умолчанию где-то ставится, и получается, что я по сути в ChatGPT не могу задать ни одного вопроса по здоровью, чтобы он не использовал ChatGPT Health, или я должен постоянно говорить его не использовать.

Упоминаются: Плагины и навыки ИИ · ChatGPT
Александр Волчек00:32:38

То есть вообще все эти подключенные плагины, они только проблемы могут создавать. Например, помню, у меня была ситуация, подключенный плагин Photoshop, значит, я прошу там что-то сделать, мне все время система пытается Photoshop, значит, говорит, открываю Photoshop для изменений. Я говорю, ты сама сделай без этого, да. И здесь возникает история, что с одной стороны плагины могут помогать, с одной стороны ограничивать, с другой стороны ограничивать.

Упоминаются: Плагины и навыки ИИ
00:32:53–00:34:51Как работать с ИИ сегодня
Александр Волчек00:32:59

И здесь такая тема, чтобы вы по-настоящему поняли, как работают модели, чтобы вы по-настоящему разобрали, что это такое, чтобы вы по-настоящему прожили новые кейсы, чтобы вы начали работать с искусственным интеллектом, не как с готовым программным обеспечением, которые и так мы все используем последние годы, десятилетия, десятилетия. Для этого вам надо все время работать напрямую с искусственным интеллектом без плагинов, вам надо работать с последними передовыми моделями без плагинов, вам надо работать с этими системами внутри, использовать ChatGPT в своей повседневной работе, в профессиональной деятельности, в обычном быте, который есть, стараться что-то сделать в Codex или в Claude Code стараться что-то сделать, не ограничиваться только профессиональной деятельностью, не ограничиваться только личной деятельностью, только это позволит вам максимально эффективный путь, по крайней мере, который я вижу для себя, позволит действительно по-настоящему серьезно понимать искусственный интеллект, понимать, как он работает и применять то, что вам надо в рамках вашего каждого дня без каких-то спорных, левых, никому не нужных дискуссий и при этом, если вы хотите протестировать какие-то дополнительные плагины, просто их тестируйте с пониманием, что это такое, а не просто в каком-то ограниченном доверии и в непонимании работы этих систем, потому что в большинстве своем вы можете реализовать эти же задачи ровно сами, только если там нет какой-то

Упоминаются: ChatGPT · Плагины и навыки ИИ
Александр Волчек00:34:29

уникальной, сверхдополнительной эксклюзивности, и, например, вам в каком-нибудь плагине не открыли доступ к какой-то базе данных, к которой вы так подключиться не можете. Что вы думаете на эту тему, обязательно напишите в комментариях, и увидимся в наших следующих выпусках.

Упоминаются: Плагины и навыки ИИ