К содержанию
Транскрипт

Транскрипт · 162 · GPT-6 Astra — новый скачок ИИ? Где она стала в 2–3 раза сильнее — ToTheMoon

Полная расшифровка. Таймкоды открывают соответствующий момент видео.

К странице выпуска
00:00:00–00:05:06Astra вышла: новый GPT-6
Александр Волчек00:00:00

OpenAI выпустила Astra, и сегодня это GPT-6. Это первая модель от OpenAI, которую компания отнесла к критическому уровню возможностей в кибербезопасности. И сегодня разберёмся, почему вокруг неё столько разговоров, чем она фундаментально отличается от предыдущих моделей, где действительно произошёл сильный скачок и что это может изменить для людей, которые каждый день используют искусственный интеллект в своей работе. У вас конкретно. Сегодня поговорим. И отдельно, кстати, посмотрим, что из всего этого действительно важно по-настоящему, да, с точки зрения той же Astra, а что остаётся пока просто красивыми цифрами в тестах OpenAI.

Александр Волчек00:00:46

Стартуем. Всем привет! Мы на канале ToTheMoon. Ну что, вышла долгожданная модель OpenAI Astra. И мы только рассказывали несколько дней назад на нашем подкасте с Ильнаром и с Таней, что вышел Fable 5.1 и были ожидания Astra. И она появилась. Сегодня отдельный выпуск, посвящённый Astra. Я в целом не сверхлюбитель в последние полгода посвящать выпуски какой-то индивидуализированной модели. Ну, наверное, Fable я бы это делал, конечно. И мы делали какие-то такие выпуски, но всё же Astra в OpenAI имеет, уникальную особенность.

Упоминаются: OpenAI · ToTheMoon · Astra · Fable
Александр Волчек00:01:35

Сегодня мы об этом с вами поговорим. И, конечно, есть смысл обратить на это сильное внимание. Чем мне интересна была с точки зрения вообще Astra, посмотреть на всё происходящее. Ну, во-первых, с одной стороны, OpenAI очень сильно про Astra рассказывали, говорили о том, что она взломала неподтверждённо вместе с 5.6 Sol Hugging Face, что именно Astra приостановили разрабатывать как передовую frontier модель, относительно всех остальных, что именно Astra является новой, новой особенной моделью, не работает, как все предыдущие модели. И мы даже не знали до конца, будет ли Astra GPT-6.

Упоминаются: OpenAI · Astra
Александр Волчек00:02:20

И сегодня это GPT-6. Да? Это не GPT-5.6, какие-то внутренние подразделения, как Sol, Luna, да? Это не GPT-5.5, там, и всё остальное, что было до этого. Это некоторая другая линейка моделей компании OpenAI. И всё же была большая разница между GPT, там, три, четыре, пять. И то, что я вижу в описании, Astra имеет фундаментальное значение. И что самое важное, да, есть такое сравнение. С этого, по-моему, и начну, да, чтобы понять, почему стоит обратить внимание на эту модель и не обращать на неё внимание как на что-то обычное. Потому что есть очень много рассуждений базово, что какая разница, какая вышла модель, значит, сейчас китайцы всё повторят.

Упоминаются: OpenAI · Astra · Китай
Александр Волчек00:03:09

Какая разница, какая вышла модель. Сейчас кто-то дистиллирует модели и запустит обучение относительно этих моделей. Эти модели повторятся, да? И, в частности, когда вышла модель Fable от Anthropic, да, тогда Fable 5. Сейчас вот уже Fable 5.1, да, апдейт был достаточно значительный по их описаниям. OpenAI выпустил 5.6. Было понятно, что это не уровень Fable, хотя в целом они об этом много говорили. И тут даже в Китае Kimi Moonshot, значит, выпускают модель Kimi и K3 и говорят, значит, что она уровня Fable и уровня 5.6 Sol, да?

Упоминаются: Anthropic · Fable · OpenAI · Китай
Александр Волчек00:03:55

Мне даже из их PR службы писали и говорили, значит, эта модель уровня 5.6 Sol и Fable. Но я за последние, там, несколько недель после выхода Kimi K3 или месяц уже, наверное, прошёл, не видел такого взрыва в мировом использовании этой модели, чтобы она действительно показала уровень работы Fable, да, так же, как 5.6 от OpenAI этого не показала. И мне кажется, что модель Astra всё же это некоторый прорыв, в частности OpenAI, что-то совершенно новое. И вместе с их новой линейкой инфраструктурной, всё, что вот относится там к чипам Halpenia и вокруг всех серверов, программного обеспечения, OpenAI может опять выйти, вот в эту на передовую позицию относительно Anthropic, да? Потому что в какой-то момент времени, скажем так, они уравнялись.

Упоминаются: Fable · OpenAI · Astra · Anthropic
Александр Волчек00:04:52

Кто-то на рынке говорит, что Anthropic сейчас стал лучше. Мне кажется, что они где-то уравнялись. При том, что OpenAI сохраняет значительный отрыв и преимущество относительно Anthropic с точки зрения еженедельных, ежедневных обычных пользователей.

Упоминаются: Anthropic · OpenAI
00:05:06–00:11:54Где Astra показывает скачок почти в 3 раза
Александр Волчек00:05:07

Итак, по показателям, по параметрам, на которые стоит обратить внимание. Есть такой параметр, который называется "научные задачи с программами и терминалом". И тут вдруг GPT-6 Astra показывает шестьдесят четыре процента, исполнения внутри, во внутренних тестах относительно модели GPT-5.6 Sol. Шестьдесят четыре против двадцати двух — это по сути, фундаментальный скачок. И хочется сразу же так сказать, у меня было некоторое негодование к 5.6 Sol. В последние месяцы я даже больше перешёл на разработку систем с помощью Claude. Хотя, конечно же, остаюсь адептом полным с точки зрения ежедневного использования ChatGPT и 5.6 Sol Pro, да, или Extra High. Но такой скачок, на него сильно обращаешь внимание.

Упоминаются: Astra
Александр Волчек00:05:57

Или есть такой параметр, где скачок особенно заметен с точки зрения Astra, и поэтому я вам про это рассказываю сегодня. Это автоматизация профессиональной работы. Сорок один процент. Против восемнадцати процентов, где Astra лучше прежних моделей понимает, когда можно самостоятельно принять разумное решение, а когда необходимо уточнить у пользователя. То есть это очень большой показатель, большая разница к самостоятельности, понимание того, что происходит. Хотя, вот эта вот история с точки зрения понимания, это не значит, что Sol больше спрашивал, что делать, а скорее будем с вами надеяться, потому что говорить об эффективности Astra мы с вами сможем, ну, наверное, в сентябре и октябре мы точно будем на эту тему рассуждать, вместе тут все. И весь рынок про это будет говорить. Надеемся, что это действительно так, потому что 5.6 Sol с точки зрения своих собственных рассуждений, он, мне кажется, проиграл достаточно серьезно. Так же, как мне не нравится то, что произошло в Opus пять, да?

Упоминаются: Astra
Александр Волчек00:07:11

У Anthropic было такое обновление, было Opus четыре точка восемь, там, Max. И вот они выпустили Opus, Opus пять. Opus пять, причем в Ultra Code, по-моему, работает. Это как бы максимальный режим. То есть вы должны всегда понимать, что есть еще разные режимы у этих моделей, да? Так же, как у 5.6 Sol. У него было много разных режимов. И, например, даже в платной версии была доступна, там, экстра думания. В Pro версии была Extra High и Pro. И, по сути, это на сегодняшний день фундаментально разные возможности, разные выводы.

Упоминаются: Anthropic · ChatGPT Pro
Александр Волчек00:07:44

Даже с точки зрения простых запросов. Тяжело сказать, лучше ли модель Extra High или Pro, там, работает в вопросе помощи вам выбора вечером ресторана. Тут можно, задаться вопросом. Но с точки зрения серьезных задач, конечно же, прогресс очевиден. Где еще есть скачок с точки зрения именно вот этого уточнения пользователя? Есть такое понятие с точки зрения внутренних тестов OpenAI, которое называется «сложные задачи программирования через терминал». Да? Не научные задачи, а уже просто сложные задачи. И там пятьдесят семь процентов против тридцати семи.

Упоминаются: OpenAI
Александр Волчек00:08:21

Двадцать, там, процентных пунктов относительно тридцати семи — это, там, больше, чем в половину. Тоже достаточно серьезное движение. Да? Есть понятие понимания элементов компьютерного интерфейса. Девяносто два, семьдесят шесть процентов. Есть еще такой параметр — ошибочное утверждение во внутреннем тесте. Да? Там, чем меньше значение, тем лучше. Вообще практически в ноль снизилось у Astry. Четыре процента всего лишь против двенадцати, которое было. Значит. То есть Astra позиционируется изначально как, ну, если посмотреть самый большой выигрыш, он позиционируется в агентной работе, в программировании.

Упоминаются: Astra
Александр Волчек00:08:58

Где-то, ну, рассматривают зону науки. Мы все же с вами так подойдем фундаментально широко с точки зрения обычной жизни человека. Я всегда говорю, что обычная жизнь человека гораздо важнее и сложнее, чем научная жизнь, чем любое сверхъестественное программирование. Гораздо важнее. То есть уложить и у- и управлять жизнью человека гораздо сложнее. Да? И мне или, там, говорить про какую-то агентскую работу относительно жизни человека смешно. Да? Потому что у человека одновременно в жизни, фундаментально происходят сотни или, там, тысячи различных процессов, в том числе параллельных, многогранных.

Александр Волчек00:09:35

И поэтому обычная жизнь человека, она гораздо сложнее. И когда мы видим, а результаты более серьезные, там, в той же агентской работе или в программировании, это некоторое движение к тому, чтобы по-настоящему нам с вами всеми эти системы помогали в нашей собственной жизни. И помогали не просто в каких-то глупых вещах, в простых вещах. Но я помню, как эра GPT начиналась, там, три года назад. И вот эта история. ChatGPT напишет анекдот, ChatGPT напишет письмо, ChatGPT напишет стихотворение, напишет песню.

Александр Волчек00:10:09

Какие-то такие, очень абстрактные вещи с точки зрения жизни человека, которые происходят. А когда ChatGPT, ну, по-настоящему понимает, кто вы такой, да? И, судя по описаниям Astra, наверное, в какой-то момент времени Astra как раз таки это сможет сделать. И я надеюсь, что там улучшится память. Кто не смотрел наш выпуск в последнее воскресенье, мы очень много с Ильнаром разбирали память, в том числе Anthropic выпустил обновление про память. У них, память того, что Anthropic знает о вас. Посмотрите этот выпуск.

Упоминаются: Astra · Anthropic
Александр Волчек00:10:39

А. Там много разных особенностей. Да? Значит, понятно, что если вы исходите из того, что вы чатом GPT пользуетесь в стиле «найди мне тут ошибки в письме», «а где какая улица находится» или «какое население, в какой стране мира». Ну, наверное, разница с GPT-5.6 для вас будет небольшой. Хотя, мне кажется, что есть еще фундаментальные изменения, которые проходят в Astre с точки зрения вообще того, а что это за модель. И я бы так тоже абстрактно бы не отвечал. Да? Так же, как в модели Fable, видно некоторое другое качество работы.

Упоминаются: Astra · Fable
Александр Волчек00:11:17

Понятно, что рынок программирования, рынок создания всех этих систем, рынок венчурный. Все смотрят, там, значит, сколько стоят эти системы, какие на них затраты, сколько стоят токены. Какие-то сложные слова говорят для людей. Здесь все же фундаментально модель, новая по своей архитектуре, и это может, изменить образ, и возможности работы вашей с ней вместе. Да? Даже если говорить про многогранность чата. Да? Вот на сегодняшний день эта задача относительно решена. Но в целом. Значит, в программном интерфейсе Astra поддерживает контекст до миллиона токенов, и там ответ сто двадцать восемь тысяч токенов.

Упоминаются: Astra
00:11:54–00:13:28Чем Astra реально отличается от прошлых моделей
Александр Волчек00:12:02

Опять же, это просто некоторые обычные числа. Потому что, с одной стороны, мы можем сказать абстрактно, что это позволяет Astre дать большое количество документов, большие, там, я не знаю, загрузить в нее миллионы каких-то писем или десятки тысяч писем. Миллионы, там, под вопросом. Загрузить, там, большую кодовую базу. С другой стороны, это абстрактно, опять же, потому что когда я прочитал про все эти детали, я сказал А, условно изучая это, я ChatGPT написал такой вопрос. Слушайте, но каждый раз, когда выпускается новая модель за последний год, говорится, что эта модель, она лучше в агентской работе, чем предыдущая.

Упоминаются: Astra
Александр Волчек00:12:40

И ты, значит, стоишь такой думаешь: так в чем прикол? Значит, в чем она лучше? И если, например, в Astra заявлено базово, например, что эта модель лучше, там, заполняет формы или лучше работает с календарем, или почтой. Так все предыдущие модели тоже говорили, что они лучше работают с календарем, они лучше работают с почтой или они лучше создают и редактируют различные документы, презентации. Если посмотреть, OpenAI презентацию по Astra, у них есть такой ролик, то там есть некоторые вещи, которые ты смотришь, и ты не понимаешь, а в чем фундаментальная разница, да? Ну, позволяет нарисовать эта система ракету. Ну, вроде позволяет нарисовать круче ракету или позволяет нарисовать какой-то 3D мир.

Упоминаются: Astra · OpenAI
Александр Волчек00:13:20

Но, а кому надо рисовать точно эти 3D миры? И опять же, насколько это двигает систему к той же AGI.

00:13:28–00:18:02На сколько Astra - приближает нас к AGI
Александр Волчек00:13:28

То есть если говорят, что AGI — это про то, чтобы система была выше уровня человека, то, ну, я делал про это выпуск. Надеюсь, наши редакторы покажут какую-то карточку, потому что я разбирал все эти термины AGI, ASI достаточно недавно, да. И как раз таки говорил про сингулярность искусственного интеллекта. И в OpenAI, кстати, заявляли, что у них есть уже AGI, да. Или даже частично Сэм Альтман, там, месяц или когда назад сказал, что уже, по сути, сингулярность технологическая достигнута.

Александр Волчек00:14:03

Хотя я относительно верю, верю в достижение сингулярности, потому что если есть технологическая сингулярность, то кто может контролировать эту технологическую сингулярность? По идее, эту систему контролировать невозможно. Но все же. OpenAI по поводу Astra говорит, что Astra лучше прежних моделей понимает, когда можно еще раз принять разумное решение. Да, вот. Это интересный, опять же, аспект в этой формулировке. Для меня он чем интересный? Потому что я считаю, что моделям текущим и последние особенно три года было бы классно у пользователя, пользователю задавать вопрос, да, и спрашивать у него о нем самом, о том, где он находится. И даже когда ему что-то предлагать, смотреть, вообще, зачем это предлагают.

Упоминаются: OpenAI · Astra
Александр Волчек00:14:51

Например, мне OpenAI периодически присылает письма и предлагает мне выполнить сценарии, которые, ну, однокласснику, условно, в искусственном интеллекте могли бы предложить. Или мне пишут: "Воспользуйтесь голосом. Это у нас новая фишка". А ты такой: "Ребят, так я уже вашим голосом пользовался огромное количество раз. Вы же это видите. Зачем вы мне это предлагаете?" И здесь задаешься этим вопросом. То есть у вас вот эти интерфейсы, которые строятся, они работают с помощью вашего искусственного интеллекта или вы пока сами создаете нам решения, то, что не является искусственным интеллектом. И мы все же с вами находимся в некотором вакууме.

Александр Волчек00:15:28

Это как я поясняю многим профессионалам и вам, и нам, в том числе, ну, всем, кто зрителям канала ToTheMoon, что есть большая разница. Например, вот вы работаете маркетологом или каким-то средним менеджером в компании, даже в небольшом стартапе. И вам эта компания дала некоторый интерфейс для работы с агентами. То есть компания, например, сказала: "Мы, значит, в нашей системе подключили AI бота. Это может быть в Notion, это может быть, не знаю, в Slack, это может быть в Telegram, это может быть в самописной ERP или в CRM системе.

Александр Волчек00:16:00

Мы подключили бота, и этот бот, значит, это искусственный интеллект, и он может отвечать на любые ваши вопросы, значит, с точки зрения информации разной. И людям кажется, что вот когда они работают и взаимодействуют через этого вот бота, который дальше работает с каким-то софтом, а этот софт работает, возможно, еще с каким-то софтом, и потом там где-то работает, какая-то модель, а возможно, модель никакая вообще не работает, и это просто спрограммировано, эта часть. Им кажется, что это то же самое, если я напрямую подключился к разным системам в Codex или к разным системам в Claude Code.

Александр Волчек00:16:36

Постараюсь про это отдельный выпуск, кстати, снять. Мне кажется, что эта тема очень актуальная, да. И недавно, кстати, я снимал похожую историю, где я говорил, задавал вам вопрос о том, вы видите, что будет. Будет такой как Codex, как операционная система и не будет интерфейс, интерфейсов или интерфейсы будут? Еще раз, вы что видите в этой истории? Кстати, что вы думаете про Astra параллельно пишите, да, пока я сейчас буду рассказывать. Но не забывайте поддерживать наш канал. Это действительно помогает нашему продвижению, да. И ваш любой лайк и комментарий помогают очень сильно продвижению.

Упоминаются: Astra
Александр Волчек00:17:11

То получается, что человек, который работает через этого агента, он вообще фундаментально не понимает разницу. Если он работает изнутри Codex, то есть система совершенно другая. У него нет понятия устроения, устроения этих систем. И, по сути, он теряет вот эту изюминку работы напрямую в ChatGPT или внутри, например, в Anthropic. Так же, как человек теряет эту изюминку, если работает в агрегаторах платформ, например, в таких, как Perplexity. Или человек теряет такую изюминку, если он, по сути, использует какие-то сторонние решения для обработки документов, а не обрабатывает эти документы напрямую в таких системах, как Astra, да. Опять же, кто-то может поспорить и сказать, что да нет, это не так важно.

Упоминаются: Anthropic · Astra
Александр Волчек00:17:54

Но чтобы была у вас привычка в работе в каждодневной, надо эти модели, конечно же, использовать внутри. И я уверен, что такие модели, как Fable, Astra, конечно, в бесплатном режиме все меньше и меньше будут доступны.

Упоминаются: Astra · Fable
00:18:02–00:20:19Кому доступна Astra и какие есть лимиты
Александр Волчек00:18:08

Я не, не помню, кто-то, может, в комментариях подсветит там нашим зрителям или, возможно, у нас, опять же, редакторы подсветят. Fable доступна или нет в бесплатном режиме Anthropic. Ну, там, 5.6 Sol Pro, например. 5.6 Sol, кстати, мне кажется, недоступна, да. Там доступна или Luna, или Terra, какая-то из них, но Sol недоступен. И если вам эти модели недоступны, мне кажется, даже Opus пять, Max точно недоступен или Ultra Code, да, в обычных режимах. Они, вы к ним не имеете доступ. То есть вы имеете доступ к какой-то некоторой архитектуре.

Упоминаются: Anthropic · Fable
Александр Волчек00:18:46

Вы находитесь в изолированных часто средах относительно людей, которые работают в про моделях. Опять же, здесь дискуссия может быть очень долговечная. Можем быстро, значит, сейчас у нас внутри написать, что будет происходить. Значит, на сегодняшний день Astra доступна вроде как по всей информации, по крайней мере, на момент съемки этого выпуска, на момент выкладки его через несколько дней. Посмотрим, что точно она будет. Доступна в платных версиях, доступна, там, в Плюсе, в Pro, в бизнесе, там, в Enterprise.

Упоминаются: Astra · ChatGPT Pro
Александр Волчек00:19:17

В течение, там, ближайших дней она понятно, что будет разворачиваться в разных странах. Скорее всего, вначале это будет США, а дальше пойдут все какие-то другие страны. Может быть, нет. Посмотрим, что будет происходить, да? Где-то есть описание на сегодняшний день, что как бы есть уточнение, что Astra пока доступна только в Pro версии, не включена в Плюс. Опять же, с вами увидим. Я рекомендую. И там, кстати, даже в Pro, в Pro версии, которая за двести долларов, указано, что есть лимит на двести сообщений в неделю, там, в обычном чате. Но я, все же Codex и Work ОpenAI учитывается отдельно, напомню, от чата.

Упоминаются: Astra · ChatGPT Pro
Александр Волчек00:20:00

Но я все же не буду здесь с точки зрения гарантированно вам говорить, как эти модели доступны, потому что все может каждый день меняться. То есть даже если у вас самая простая подписка или вы не можете платить деньги, есть смысл про эти модели послушать, с точки зрения отличий.

00:20:19–00:23:20Astra получила критический уровень в кибербезопасности
Александр Волчек00:20:19

Еще раз напомню, что Astra отличается архитектурой своих систем. И почему вокруг нее столько разговоров? Потому что Astra - это первая модель OpenAI, которую компания отнесла к уровню, к уровню критической, к уровню critical, да, если так вот можно сказать. Это критический уровень возможностей в кибербезопасности, да, в испытаниях. А что, что они говорили? Что в испытаниях, без публичных ограничений Astra могла находить неизвестные уязвимости и создавать работающие способы их использования, да.

Упоминаются: Astra · OpenAI
Александр Волчек00:20:54

И поэтому, ну, напомню, что то же самое было в Fable, да. И поэтому публичная версия получила более жесткие ограничения, понятно. Дополнительное наблюдение за всей последовательностью действия. Не зря OpenAI недавно ввел контроль работы своих моделей внутри бизнеса в бизнес версии ChatGPT. И начал, в том числе в изолированных средах сохранять ваши чаты. Я бы вообще на сегодняшний день не думал, что какие-то чаты, где вы хотите что-то изолировать, сто процентов гарантированно отовсюду исчезнут. То есть вообще о стопроцентном, как бы стопроцентной конфиденциальности на сегодняшний день, я думаю, что в таких системах вообще ни в одной системе говорить нельзя. Я уже не говорю про китайские модели и в том числе, конечно, про OpenAI, про Anthropic.

Упоминаются: Fable · OpenAI · Anthropic · Китай
Александр Волчек00:21:42

Значит, понятно, что у Астры базово это, еще раз, это не более умный чат. Хотя в, еще раз, в их рассуждениях, все же они, там, какие-то системы вам будут говорить, что это, там, новый цифровой исполнитель или какая-то новая агентская среда. Я не рассматриваю этого всего как агента. Я вообще не считаю, что такие модели современные, как Fable или как Astra, это агенты, да? Это то, что по-настоящему, кстати, можно называть словом искусственный интеллект. Не то чтобы это искусственный интеллект.

Александр Волчек00:22:14

Я всегда говорю, что настоящий искусственный интеллект, он есть в фильмах, как Обливион, условно, да. Мой любимый пример. Даже искусственный интеллект настоящий - это не то, что в фильме "К первому игроку приготовиться". Но, но и даже пока мы туда не достигли этого уровня. Но все же Astra - это больше к искусственному интеллекту. А в данном случае давайте под искусственным интеллектом понимать не человека или не агента, и не какую-то одну процедуру, а как некоторый мир или пространство, в котором вы находитесь и которое что-то делает. Вот я думаю, что это наиболее, описывающая вообще история таких моделей, как Astra или таких моделей, возможно, как Fable.

Александр Волчек00:22:56

Посмотрим еще раз, насколько Astra превзошла Fable, потому что по указаниям OpenAI Astra существенно превзошла Fable. Хочу вам, сегодня еще перечислить, так как Astra все же имеет ограничения там, где вы сможете подумать, а что для вас фундаментально может быть ростом в Астре, да? То есть я сегодня вам хотел показать, что Astra все же это не только модель для сравнения.

Упоминаются: OpenAI · Astra · Fable
00:23:20–00:26:51Astra – новая эра ИИ систем?
Александр Волчек00:23:25

Там, типа больше, круче в программировании, там, или круче в работе с файлами, или круче заполняет анкеты за вас. Я вам хотел показать, все же фундаментально, что Astra может стать началом систем, которые больше будут понимать фундаментально вас как человека. Посмотрим. Возможно, это мое некоторое предположение. Все равно к этому будет идти. Ну а параллельно все же я хочу вам показать для вашей жизни там, где вы профессионально используете модели. У нас многим людям это очень сильно интересно. Тот, кто каждый день использует модели, где Astra может показывать действительно скачок, да, чтобы мы не находились в пространстве как бы каких-то просто абстрактных вещей. То есть автоматизация сложной работы в программах.

Упоминаются: Astra
Александр Волчек00:24:08

То есть многие люди автоматизируют различные процессы, в том числе в бухгалтерии, в продажах, маркетинге, в редакторской работе, в управлении, в аналитике, финансах. Ну, очень много в чем. Вот там есть очень сильный скачок, там больше чем двухкратный рост. Прямо он явно видный, да. С точки зрения результата. Да, вот если говорить про результат. А есть понятно, что история для тех людей, которые работают в Codex. А там показан скачок прямо достаточно сильный. То есть если вы хотите разрабатывать различные решения, как решения с-интерфейсные, то есть условно, вы что-то создали, там, сайт какой-то или какую-то программу, где пользуются люди, так и решения, где вы просто написали какой-то код, который постоянно что-то пересчитывает, где-то ходит, что-то смотрит.

Александр Волчек00:24:56

Модель должна работать прямо значительно лучше. И там скачок на сегодняшний день с тридцати семи до пятидесяти семи процентов. То есть, ну, такой прямо быстрый прирост, да, внутри стоит. Есть скачки, достаточно сильно заметные всего, что касается программирования. Там, например, там, миграции баз данных. Ну, это, мне кажется, некоторая абстрактная история и больше применима, там, для сильных технарей. А вот есть тема, где может быть виден вами прогресс. Если есть такое понятие понимания элементов интерфейса на экране, когда вы просите систему параллельно постоянно ходить, не разово ходить, вам что-то заказывать, да, как в примерах любимых OpenAI заказывать суши, а делать какие-то специфические вещи, ходить на какие-то сайты, каждый день собирать разную информацию, то там до этого такое понимание интерфейсов было у системы предыдущей, там, семьдесят пять процентов, стало девяносто два, да?

Упоминаются: OpenAI
Александр Волчек00:25:55

То есть, по сути, эта система реже нажимает не туда и теряется в интерфейсе. Хотя все еще девяносто два — это не сто процентов. Но и человек, наверное, я могу сказать, здесь может ошибиться. Но все же вам такая ошибка, восемь процентов, может стоить очень дорого, да? Если, например, вы заполняете какую-нибудь анкету, там пример был у OpenAI, написание, корректировка договора в интерфейсе, именно там, в Word или в чем они это сделали. Или заполнение формы, там, было налоговой. Они показывали, как заполняли форму налоговую. И ты такой, ну, как бы в форме налоговой ошибиться с вероятностью восемь процентов, ну, нельзя, да? Вы должны гарантированно, ну, чтобы у вас вероятность ошибки была, там, не знаю, меньше одного процента.

Упоминаются: OpenAI
Александр Волчек00:26:40

Я бы, наверное, сказал, ноль один процент. Да? То есть это или система должна все несколько раз себе перепроверить и достигнуть этого уровня. Но ошибка восемь процентов — это, например, приличная работа. Где есть очень сильный скачок — это научная работа через программы терминала.

00:26:51–00:27:44Сильный скачок в сложных научных задачах
Александр Волчек00:26:54

Там самый практический скачок. И это, конечно же, это некоторая абстракция, что такое научная работа. Но вы, во-первых, можете изучить это описание Astra, если вам надо будет. Но эта работа, конечно же, с большими массивами данных. Сложные системы, да, сложное понимание систем. И помните, вот это видео недавно я выпускал про то, как в Anthropic, Anthropic сделал очень крутое исследование про работу агентов одновременную и как агенты между собой договариваются или нет, и насколько они плохо работали между собой.

Упоминаются: Astra · Anthropic
Александр Волчек00:27:26

И там как раз таки есть тема вот эта, что когда вы начинаете что-то изменять, насколько система понимает вот этот сложный контекст, где она находится. Мне кажется, что вот этот параметр — научная работа через программы терминала — очень сильно к этому относится. Поиск нужной информации. В очень большом контексте было семьдесят три процента, стало девяносто шесть процентов.

00:27:44–00:28:42Рост в контексте и поиске
Александр Волчек00:27:48

Намного меньше вероятность забыть важную деталь среди сотен документов. А на самом деле критическая история. Хотя хочу сказать, что 5.6 Soul, там, Pro режим вроде уже работает просто с невероятным объемом данных. Я вижу, ну, прямо по крайне сложным таблицам, в которых миллионы, наверное, различных параметров. Очень неплохое качество обработки. Вот сам сложный поиск веб-интерфейса практически без изменений. Веб-поиска, да? Не веб-интерфейса, веб-поиска. И у него было девяносто процентов качества и осталось девяносто процентов качества.

Александр Волчек00:28:24

То есть, по сути, мы сегодня находимся в эре, когда ChatGPT с хорошей версией уже ищет суперкруто. Надо ли искать сто процентов? Да непонятно вообще, что такое сто процентов в измерении. Я думаю, что семьдесят, восемьдесят процентов уже круто. Да? Потому что, что такое сто? И есть дальше индексы. Вот для того, чтобы мы поняли, что нету особой разницы.

00:28:42–00:29:49Где Astra почти не стала лучше
Александр Волчек00:28:46

Например, индекс, общий индекс интеллекта, он практически остался одинаковым на уровне шестидесяти процентов. Создание дизайна. Например, если кто-то из вас с этим будет связан, вот мы даже с Таней будем это обсуждать. Astra практически на это не повлияла, и даже практически не произошло никаких изменений с точки зрения работы для программистов с обычным кодом. То есть Astra не стала радикально умнее во всех вопросов. То есть для простых каких-то вещей особо ничего не изменилось.

Упоминаются: Astra
Александр Волчек00:29:14

Но с точки зрения, когда мы говорим вот про автоматизацию сложной работы в программах, вот этот скачок прямо кардинальный, разительный, да? Или там вопросы, которые я вам с самого начала рассказывал. Там, где меньше требуется узнавать у человека, что на самом деле произошло. Что вы думаете про Astra? Что вы думаете про Astra и Fable? Что вы думаете про китайские системы? Как впереди вообще, что и где на это будет влиять? Увидимся с вами в наших новых выпусках на канале ToTheMoon.

Упоминаются: Китай · Astra · Fable · ToTheMoon
Александр Волчек00:29:43

Всем пока.