За что платить человеку, если всё больше работы делает ИИ? Опыт OpenAI
Что на самом деле стоит за $600 в день и тремя днями агентского времени на одного сотрудника OpenAI — и где заканчивается автоматизация и начинается человек, который ставит задачу и проверяет результат?
Отчёт OpenAI от 6 сентября показал: медианный исследователь компании расходует модели на $600 в день по внешним ценам, отдельные — до $7000, а агентское время выросло с восьми часов до более чем трёх дней на один человеческий день. Число экспериментов на человека в августе стало рекордным за два года, несколько команд сократили технические консультации, одна отменила их совсем. При этом больше половины успешно завершённых задач на 4–8 часов человеческой работы потребовали хотя бы одного вмешательства — поэтому система по-прежнему «стажёр». Мониторинг безопасности добавляет около 20% вычислений, а $600 в день превращаются в $12 000 в месяц на сотрудника. Ведущий показывает, что эти цифры не говорят ни о замене людей, ни о размере экономии: речь о передаче операций, а не должностей.
На что обратить внимание
Ключевые тезисы и выводы
У половины исследователей OpenAI использование моделей по внешним ценам стоило бы больше $600 в день — без учёта зарплаты. Вопрос выпуска: что им поручают на такие суммы, что они перестали делать сами и почему человек всё равно нужен.
Системе поручают задания на несколько дней квалифицированной работы, но постановка, руководство и проверка остаются за человеком. Главное изменение: ИИ не подсказывает, что делать, а выполняет существенную часть работы — ошибки, эксперименты, анализ результатов.
Это анализ собственной практики, а не эксперимент с контрольной группой. Рост экспериментов нельзя целиком записать на счёт ИИ: одновременно могли вырасти мощности, улучшиться инфраструктура, прибавиться специалисты.
Один агент готовит код, другой пишет проверки, третий разбирает сбой, четвёртый собирает результаты — механика Codex. Содержательные вопросы — одинаковые ли условия, воспроизводится ли результат — остаются исследователю.
OpenAI за модели не платит и посчитала, сколько заплатили бы другие. Мерка ведущего: как нанять программиста, который тратит на модели по $300–500 в день; за суммой могло стоять выполнение сотни задач.
До июня агент работал меньше дня, в августе — больше трёх дней на один человеческий. Учитываются пики параллельности и агенты, запущенные агентами, поэтому коэффициент больше единицы.
3,1 не значит, что у каждого постоянно работали три помощника, и не значит, что агенты трудятся сутками без остановки. При этом агентам стали чаще поручать более длительные и сложные задания.
Исследование делалось ещё на GPT-5. Альтман зовёт пробовать Astra как инструмент для целой работы; ведущему нужен месяц-два, а запуск, по его мнению, подгоняли IPO Anthropic и выход Fable 5.1.
Августовское число экспериментов стало максимальным с начала 2025 года, хотя одновременно выросли и мощности. Когда подготовка дешевеет, проверяют все варианты, и даже отрицательный результат экономит время и деньги.
Польза — в устранении повседневных задержек, когда не ждёшь коллегу. Обратная сторона — процессы и согласования, которые нельзя обойти; корпорации с бесконечными совещаниями к такому темпу не готовы.
Рамка 4–8 часов — оценка человеческой работы, а не время агента; «успешно» не значит «самостоятельно». Стажёр — мера самостоятельности, а не знаний, и успех на одном типе задач не переносится на профессии.
Нельзя вывести ни число заменённых, ни размер экономии. Если агент подготовил работу неправильно и её переделывают шесть часов, экономия исчезает; а часть работы можно было вообще не делать.
Чем шире доступ агента, тем важнее контролировать способ получения результата. Августовская пауза в обучении с подкреплением и взлом Hugging Face; $600 × 20 дней = $12 000 в месяц на сотрудника.
Ориентир разработки, а не обещание. Пахоцкий описывает цикл, где ИИ всё больше участвует в создании следующих поколений ИИ, и настаивает на сохранении контроля и соотнесении скорости с мерами безопасности.
Десятки, иногда сотни параллельных чатов и задач в Codex, Claude Code и ChatGPT. Там, где участвует много людей, параллельность невозможна — ответа ждёшь по три-четыре дня.
О чём этот выпуск
Соло-выпуск ToTheMoon об отчёте OpenAI от 6 сентября о том, как её собственные исследователи работают с ИИ-агентами. Александр Волчек начинает с трёх цифр: у половины исследователей использование моделей по внешним ценам стоило бы больше $600 в день, отдельные доходили до $7000, а агентское время превысило человеческое в 3,1 раза. И сразу оговаривает: это анализ собственной практики, а не контролируемый эксперимент, и ни одна из цифр не означает замены людей.
Компания объявила, что достигла уровня «автоматизированного исследователя-стажёра»: системе поручают задания, на которые квалифицированному человеку нужно несколько дней, но постановка, сопровождение и проверка остаются за сотрудником. Главная перемена — ИИ не подсказывает, а выполняет существенную часть работы: разбирает ошибки, запускает эксперименты, анализирует результаты.
Чтобы показать, откуда берутся такие суммы, ведущий разбирает один эксперимент: гипотеза о новой организации обучающих данных требует подготовить данные, изменить код, запустить обучение, разобраться со сбоями и сравнить результаты. Эту работу делят между агентами по механике Codex — один готовит изменения, другой пишет проверки, третий разбирает неудачу, четвёртый собирает результаты, — а содержательные вопросы остаются исследователю.
$600 — медиана по внешнему прейскуранту: OpenAI за модели не платит и посчитала, сколько заплатили бы другие. Ведущий предлагает мерку: это как нанять программиста, который каждый день тратит на модели по несколько сотен долларов. Вторая цифра — время агентов: до июня меньше восьми часов, в августе больше трёх дней на человеческий день, потому что агенты работают параллельно и запускают других агентов. При этом пик параллельности и суммарные часы — разные показатели, и 3,1 не значит «три помощника у каждого».
Отступление про Astra: исследование делалось ещё на GPT-5, а Сэм Альтман зовёт пробовать новую модель как инструмент для целой работы. Ведущий не торопится с выводами — оценка модели требует месяца-двух — и считает, что OpenAI торопилась с запуском в преддверии IPO Anthropic и выхода Fable 5.1.
Что изменилось внутри: код вносится быстрее, августовское число экспериментов на человека стало рекордным с начала 2025 года (одновременно выросли и мощности), а когда подготовка дешевеет, проверяют пять вариантов вместо одного — и даже отрицательный результат экономит деньги. Несколько команд сократили технические консультации, одна отменила их совсем. Ведущий видит здесь и обратную сторону: корпорации с бесконечными совещаниями и согласованиями к такому темпу не готовы.
Почему по-прежнему «стажёр»: больше половины успешно завершённых задач на 4–8 часов человеческой работы потребовали хотя бы одного вмешательства. «Успешно» не значит «самостоятельно»: агент сравнил результаты на разных данных, человек заметил, агент переделал. Стажёр — мера самостоятельности, а не знаний, и успех на одном типе задач не переносится на профессии. По этим цифрам нельзя вывести ни число заменённых работников, ни размер экономии: речь о передаче операций, а не должностей, и переделка легко съедает сэкономленные часы.
Безопасность: чем шире доступ агента, тем важнее контролировать способ получения результата; мониторинг добавляет около 20% вычислений, а $600 в день превращаются в $12 000 в месяц на сотрудника. Заявленная цель — автоматизированный исследователь к марту 2028 года под надзором человека; Якуб Пахоцкий описывает цикл, где ИИ всё больше участвует в создании следующих поколений ИИ. В финале — личный опыт ведущего: десятки параллельных задач в Codex, Claude Code и ChatGPT, и вопрос к зрителям, сколько у них таких дней.
Выпуск ценен тем, что переводит громкие цифры в понятные единицы: $600 в день — это медиана по внешним ценам, три дня — сумма параллельных агентских часов, а «стажёр» — честная мера самостоятельности, при которой больше половины задач всё ещё требуют человека. Отсюда и главный вывод для читателя: считать надо передачу операций, а не должностей, экономию — по итогу с переделками, а не по запуску, и держать в уме, что мониторинг и доступ стоят денег. Ведущий не обещает ни революции, ни катастрофы — он показывает, как устроена работа, в которой ИИ делает существенную часть, а решения остаются за человеком.
Расшифровка выпуска
Голосовая связка применена к 48 сегментам: 48 определено, 0 содержат несколько определённых участников, 0 вероятных, 0 остаются без окончательной идентификации. Неподтверждённые голоса обозначены как «Участник дискуссии», фрагменты с несколькими подтверждёнными участниками — как «Микс».
Загрузка…