Искусственный интеллект в Тупике? Почему данные больше не работают
Что происходит, когда качественные данные заканчиваются и модели начинают учиться на собственных результатах?
Проверить, помогают ли Синтетические данные и OpenAI развивать навык или лишь скрывают отсутствие понимания; оценка должна проверять, помогает ли модель учиться или лишь переносит на себя решение и оценку.
На что обратить внимание
Ключевые тезисы и выводы
Оценивать тему «Первый этап развития больших моделей был прост по логике» нужно с учётом того, что логика «собрать как можно больше человеческих текстов, изображений и кода» упёрлась в предел: книги, сайты и открытые архивы уже использованы, а новые качественные данные появляются медленнее, чем растут вычисления.
Рабочий вывод из сцены «Синтетические данные и их влияние на ИИ и будущее» состоит в том, что хорошая модель может придумать задачу, проверить решение и создать миллионы тренировочных примеров, но если она воспроизводит собственную ошибку, следующая система принимает её за истину — и синтетические данные превращаются в замкнутую петлю.
Оценивать тему «На сколько новые данные важны, чтобы создать AGI» нужно с учётом того, что для AGI как самоулучшающейся системы важен не объём, а специфичные данные о том, как тренируются модели; всё, что создаст независимая система, по определению будет синтетикой — задача в том, чтобы она была качественной, а сегодняшняя синтетика ещё подвержена галлюцинациям.
Сцена «Автономные неигровые персонажи от Nvidia» подводит к рабочему выводу: на CES 2025 NVIDIA показала NPC, которые больше не следуют скрипту, а развиваются сами — оставил игру на сутки, и персонаж прожил собственную жизнь; открытым остаётся вопрос, на каких данных всё это учится.
Сцена «Кейсы применения ИИ в медицине» подводит к рабочему выводу: по стоматологическим снимкам модель дала ведущему больше деталей, чем три врача, а немецкое исследование рака груди на 460 тысячах пациенток показало рост точности диагностики почти на двадцать процентов — ценность ИИ появляется в связке с врачом.
Из разговора о «Выпуск автономного AI-агента от OpenAI» следует практическая проверка: Operator — автономный агент для сложных задач вроде написания кода и бронирования поездок с минимальным участием человека; ожидания от первого квартала низкие, но к концу года агенты начнут заметно менять рабочие процессы — на это ставят все три главных игрока.
Сцена «Организация путешествий через ИИ» подводит к рабочему выводу: обещание агента быстро сталкивается с Kayak, Aviasales и Airbnb — если специализированный сервис ищет лучше и прозрачнее, универсальный чат не создаёт ценности только потому, что умеет разговаривать; главный риск — привыкнуть к одному посреднику как единственному окну.
О чём этот выпуск
Большие модели уже поглотили книги, сайты и открытые архивы. Следующий этап строится на синтетических данных — примерах, которые создают другие модели. Это может ускорить развитие, но одновременно замкнуть систему в собственных ошибках. На фоне этого рынок проверяет агентов, медицинские сценарии и путешествия, где качество легко сравнить с обычными сервисами.
Первый этап развития больших моделей был прост по логике: собрать как можно больше человеческих текстов, изображений и кода. Но этот ресурс не бесконечен.
Книги, сайты и открытые архивы уже использованы, а новые качественные данные создаются медленнее, чем растут вычисления. Поэтому компании всё чаще обучают модели на синтетических примерах — данных, которые генерирует сам ИИ.
Это не обязательно тупик. Хорошая модель может придумать сложную задачу, проверить решение и создать миллионы полезных тренировочных примеров. Проблема начинается, когда она воспроизводит собственную ошибку, а следующая система принимает её за истину. Если качество исходного генератора не контролируется, синтетические данные быстро превращаются в замкнутую петлю.
Именно поэтому Илья Суцкевер и другие исследователи ищут новые фундаментальные подходы, а DeepSeek показывает, что прогресс может прийти не только через ещё больший объём данных. Ограничения в США способны замедлить местные компании, но не остановят разработчиков в странах, где правила другие. Гонка становится не только научной, но и регуляторной.
Практические продукты позволяют проверить реальную границу. В медицине ИИ может повысить точность диагностики, если работает вместе с врачом и на проверенных данных. В путешествиях обещание агента быстро сталкивается с Kayak, Aviasales или Airbnb: если специализированный сервис ищет лучше и прозрачнее, универсальный чат не создаёт ценности только потому, что умеет разговаривать.
Главный риск — привыкнуть к одному посреднику. Как Amazon приучает не сравнивать цены, так ИИ-агент может стать единственным окном, через которое человек планирует поездки, покупает услуги и получает рекомендации. Поэтому качество данных — не абстрактная проблема исследователей. От него зависит, какие варианты система вообще покажет и какие решения пользователь перестанет проверять.
Качество данных — не абстрактная проблема исследователей. Поэтому от него зависит, какие варианты система вообще покажет и какие решения пользователь перестанет проверять.
Расшифровка выпуска
Голосовая связка применена к 87 сегментам: 53 определено, 4 содержат несколько определённых участников, 19 вероятных, 11 остаются без окончательной идентификации. Неподтверждённые голоса обозначены как «Участник дискуссии», фрагменты с несколькими подтверждёнными участниками — как «Микс».
Читать транскрипт на отдельной странице
Загрузка…