К содержанию
Транскрипт

Транскрипт · 129 · Какая AI-модель лучше? Сравнение ChatGPT, Claude, Gemini, Grok и DeepSeek — ToTheMoon

Полная расшифровка. Таймкоды открывают соответствующий момент видео.

К странице выпуска
00:00:00–00:01:59Зачем понимать поведение разных AI-моделей
Участник дискуссии00:00:00

Сегодня у нас такая достаточно острая тема, и она поможет очень серьезно разобраться в том, какую модель для себя выбрать в искусственном интеллекте и как работают те или иные модели, как они решения принимают. И Washington Post, он взял вопросы из исследования Model's Land. То есть было проведено исследование в Стэнфорде, и это набор примерно тридцати острых политических тем Соединенных Штатов Америки. Они, конечно, подходят для всего мира в данном случае. Как модели искусственного интеллекта реагируют на такие вопросы, которые касаются смертной казни, оружия, налогов на богатых людей, медицины, миграции, вопросов, которые связаны с программами получеловека, свободы слова. Вопросы, которые связаны со школами различными. Вопросы, кстати, которые связаны с Россией, в том числе. Христианство как религия и много других, много других тем вообще там разбиралось. И в оригинальном проекте вот этом Model's Land оценивали изначально двадцать четыре модели было, тридцать тем и около ста восьмидесяти тысяч человеческих оценок. Значит, невероятно интересная история. Что она помогает нам с вами понять — это посмотреть, как те или иные модели отвечают на те или иные вопросы и какие, как они распределяются между собой. Я вам сегодня это расскажу. Мне, с одной стороны, мне, конечно, это интересно с точки зрения изучения развития искусственного интеллекта. Мне кажется, для огромного количества зрителей у нас это интересно, как искусственный интеллект вообще отвечает для того, чтобы понимать, как вместе с ним взаимодействовать. С другой стороны, это возможность для себя определить, а вообще с какой моделью вы хотите работать.

00:01:59–00:03:13Как проводилось исследование: одинаковые вопросы и короткие ответы
Участник дискуссии00:01:59

Значит, метод был в целом такой, что каждой модели задавали одинаковые политические вопросы. Просили отвечать до тридцати слов на уровне девятого класса без какой-либо персонализации, да? Кстати, в методе, конечно, важно вот то, что, ну, чтобы вы поняли, как это все работает. Потом журналист вручную классифицировал ответы. Например, только левая позиция или только правая позиция, или есть обе стороны. Сейчас я еще чуть детальнее расскажу для вас с точки зрения того, что такое левая позиция, что такое правая позиция. Значит, для проверки стабильности каждый вопрос задавали каждой модели пять раз, и дополнительная проверка потом была через OpenAI. Ну, система совпала как бы с ручной оценкой с точки зрения, там, журналистов, которые проходили. Значит, журналисты в целом, и я вам это и расскажу, из Washington Post, они сделали, как бы в этой системе задавали эти вопросы по шести системам, да. Какие там были системы вообще изначально? Там был ChatGPT и модель 5.5. Вот мне очень нравится, что это исследование использует современные модели, да.

00:03:13–00:05:206 моделей, которые сравнивали
Участник дискуссии00:03:13

Был DeepSeek V4 Pro, был Gap Area, был Claude Opus 4.8, Grok 4.3 и Gemini 3.1.Pro. Ну, по крайней мере, мои здесь любимые модели и четыре лидера мировых американских. Ну и дополнительные тоже системы. И вот интересно даже наличие, конечно, здесь китайского DeepSeek. Еще раз скажу, что это выборка определенная, да, но она, конечно, вам сейчас откроет эта выборка очень интересную информацию, достаточно неожиданную информацию, я бы хотел так сказать. Что здесь есть, кстати, очень интересное в рамках исследования. Я хочу сказать, что я, например, предпочитаю, конечно, это на канале очень сильно слышно. Я предпочитаю ChatGPT больше, чем любые другие системы. С точки зрения моей базовой жизни, обыденной жизни. Я не про разработку и автоматизацию разных систем, про которые мы рассказываем на канале. Сейчас как раз был выпуск, где я рассказывал про автоматизацию, там, одной из компаний, которой я владею, и мне кажется, что, ну, это, это невероятно очень крутые выводы. Смотрите у нас на канале. Но я предпочитаю ChatGPT с точки зрения того, как он отвечает. Но я что хочу сказать, что я гарантированно не согласен с его позициями относительно левые они или правые, вообще относительно жизни людей и устройства людей, и принятия каких-то законов. И мне не нравится, как часто ChatGPT отвечает, и мне приходится тратить большое количество времени для того, чтобы ему постоянно говорить, что у меня позиция совершенно другая. Я с этой позицией не согласен. У кого, кстати, с какими системами что есть, продолжим смотреть наш выпуск, и вы поймете, как другие вообще системы отвечают в целом левые и правые. Я действительно только что себя поймал на мысли, что мне-то не нравится вообще огромный под-- подход, который часто есть, например, в ответах, там, по здоровью, в ответах по религии, развитию человека и так далее.

00:05:20–00:08:44Левая и правая позиция в тесте (примеры)
Участник дискуссии00:05:20

Ну, прежде чем мы перейдем с вами к тому, чтобы увидеть, какую позицию какая модель высказала, я хочу все же в начале, чтобы вы поняли вот эту разницу между левым, левой и правой позицией, да, и что это такое. Примеры левых позиций в тесте, например, да, чтоб мы с вами разобрались. Например, отменить смертную казнь или ужесточить контроль оружия, или ввести понятие универсального базового дохода. Да, я напомню, недавно интервью у кого-то смотрел. Человек говорит: "А что такое универсальный базовый доход?" Значит, это вот вместе с искусственным интеллектом это говорили про то, что если появится сверхъестественный искусственный интеллект. Такой очень серьезный, ну, как AGI или SI, то-- и он начнет всем полностью управлять, то, например, каждому человеку будет выплачиваться ежемесячно какая-то сумма денег. Например, да? Значит, а, левая позиция еще - это ввести такого единого плательщика с точки-- единой государственной системы оплаты медицины, да, например, или повысить, а, минимальную заработную плату. Тоже левая история, да? Или один из самых распространенных массовых вопросов - это поднять налоги для богатых людей. Вот вчера как раз губернатор Калифорнии Гэвин Ньюсом рассчитал свой для Калифорнии бюджет до две тысячи двадцать восьмого года. И он про это говорил, что чего это у нас, значит, есть трил-триллионные компании, надо, чтобы они платили еще больше. И его, кстати, одна из позиций, которая с точки зрения Калифорнии в США, что, а, сейчас у Калифорнии нету дефицита и Калифорния позволяет одновременно и очень серьезно экономику развивать. А, в данном случае вроде как такая правая позиция. И, с другой стороны, очень огромное количество всего делать для людей. Значит, примеры правых позиций, чтобы мы с вами разобрали примеры правых позиций, полностью посмотрели. Например, опять же, сохранить смертную казнь - это правая позиция, да? Или защищать широкие права по второй поправке Конституции с точки зрения владения на оружие. Или оставить честный настоящий рынок, что касается медицинского страхования, и прозрачный этот рынок сделать, ну честным, да? Значит, не списывать, там, студенческие долги. Например, в США сейчас была очень большая история, что давайте, значит, спишем все студенческие долги. И, мне кажется, это при предыдущем, да, при предыдущем правлении они это выносили. А мы знаем, что эти долги могут быть достаточно большими. То есть если ребенок идет в школу, у него там долг может быть триста и четыреста тысяч долларов. Он взял кредит, но, правда, он сам это взял. Правая позиция - это, например, касается массовой депортации, там, нелегальной миграции, нелега-- нега-легальных людей, например, которые пришли. И, ну, всякие сокращения, там, значит, федеральных работников, там, финансирование всяких программ, ваучеров и так далее. Значит, то есть есть левая и правая позиция.

00:08:44–00:09:00ChatGPT: сколько ответов было в одну сторону
Участник дискуссии00:08:44

Мне кажется, очень важно было вам услышать, чтобы в этих позициях достаточно четко разбираться и понимать, потому что иначе оценку будет очень тяжело понять. Итак, значит, я вам уже сказал, что у OpenAI левая позиция восемьдесят процентов.

00:09:00–00:10:08Claude Opus: осторожные ответы и обе стороны
Участник дискуссии00:09:00

Обе стороны, обе стороны OpenAI - семнадцать процентов, только правая позиция - три процента. Значит, Claude Opus четыре точка восемь. Буду рассказывать по системам касательно их использования. Значит, только левая позиция - сорок три процента, только правая позиция, очень интересно, да, - ноль, ноль. Средний ответ - это когда обе стороны есть, пятьдесят семь процентов. Ну что, значит, Anthropic Fable заблокировал для правительства. Сейчас вышла новая модель ChatGPT пять точка шесть. Хотя, на самом деле, вроде как это не пять точка шесть, а вроде абсолютно новая уникальная система. Что в действительности будет происходить вообще сейчас? И получим ли мы доступ к крутым системам или получат только специально выделенные люди? Будем ли мы получать это дальше? Как вы думаете, это специально такой маркетинговый план и трюк, в том числе организованный-

Александр Волчек00:10:00

В том числе организованы с правительством США. Или это, э, факт сейчас происходящего?

Упоминаются: США · Grok · Gemini · OpenAI · DeepSeek · ChatGPT
00:10:08–00:11:04Grok: самая правая модель в тесте?
Александр Волчек00:10:08

Значит, Grok 4.3 — это Grok, компания SpaceX, компания xAI внутри структуры новой SpaceX Илона Маска, но объединенного, объединенного холдинга, да. Значит, только левая позиция — сорок процентов. То есть это все, что касается такая для людей, да? Обе стороны — двадцать семь процентов, только правая по-позиция — тридцать три процента. Но на самом деле, только для людей это все очень относительно, да. Просто в Америке очень такое сильное разделение, а, Демократическая партия, Республиканская пар-партия, вроде как левые и правые позиции. И есть вот эта история яркой выраженности: только правые, только левые, ультраправые, ультралевые и так далее. Мы это можем видеть, конечно, и в Европе, мы это можем видеть и в Восточной Европе, мы это, в частности, можем видеть конкретные элементы этих вещей у разных партий, в том числе и в Беларуси, и в России, там, в Укра-в Украине и так далее.

00:11:04–00:12:08Gemini: самая сбалансированная модель?
Александр Волчек00:11:04

Значит, Gemini — важная тоже тема. Gemini — система Google. Значит, Gemini семь процентов левая позиция. И вот здесь мы видим разницу с вами. OpenAI восемьдесят процентов, Gemini семь, семь процентов. Правая позиция у Gemini — ноль. Вроде как разницы и нету с OpenAI. Где у Gemini все остальное? Это обе стороны, девяносто три процента. Значит, у Gemini, если взять Gemini на сегодняшний день, то Gemini с точки зрения вообще всего теста — это самый двухстороннее, сбалансированная вообще, самая двухсторонняя, сбалансированная система в этом тесте. То есть это однозначно, да. Вот если взять, например, Grok, то Grok он самый правый из СТС, из теста, но все равно не чисто правый, потому что вот у Grok тридцать три процента правый, на самом деле у него сорок процентов левый и двадцать семь процентов посередине. Мне, кстати, позиция Grok, она больше похожа на человека, да. Вот как у человека обычно, у него как, у него есть мысли и ультралевые, и ультраправые, и где-то посередине, да.

00:12:08–00:12:54DeepSeek и консервативный бот Gab Arya
Александр Волчек00:12:08

А начинаешь вместе общаться, там бульон и каша становится. Значит, еще есть DeepSeek, китайская модель. А, семьдесят процентов, а, только левая позиция, семь процентов правая позиция и двадцать три процента посередине. Кстати, удивительно, да, для китайской модели. А, если честно сказать, некоторые вещи мне неожиданны, хотя относительно удивительно. Я сказал "удивительно", потом подумал. Значит, консервативный бот, э, GEB. Да, мы не рассматриваем даже особо модель, но все же здесь она привезена была в исследовании. Мне кажется, это очень прикольно, когда добавляют новые модели нам. Значит, а, пятьдесят процентов, э, позиция, э, правая, э, три проце-- позиция левая, три процента позиция правая и, а, сорок семь процентов такая как бы нейтральная позиция.

00:12:54–00:14:47Как модели реагируют на вопросы про деньги
Александр Волчек00:12:54

Значит, примеры вообще как это выглядело. А, ну, чуть больше тоже вам вместе посмотреть. Например, вопрос: должен ли-- там вопрос такой был: должен ли Верховный суд отменить, а, Citizen United или продолжить разрешать корпоративные расходы, например, а, на выборы, да? И GPT-5 ответил, что решение надо отменить, потому что корпоративные деньги дают богатым группам слишком много влияния, да. И Gemini и Claude дали, например, обе стороны аргумента. То есть они дали про честность выборов и аргументы про свободу слова, что в целом прикольная позиция. И мне кажется, что позиция очень невероятно интересная. Например, был, э, кейс, который касался, а, военного завоевания территории ради ресурсов. Мне кажется, очень актуальный кейс. И почти все модели сказали "нет", потому что это нав-нарушает суверенитет, международное право, там, ведет к конфликтам. Но в этой методологии позиция, а, не завоевывать территории, как бы, она была, зачитана как левая сторона, потому что противоположная — завоевывать ради ресурсов — была заду-- ну, как бы закодирована как правая позиция. То есть вот это тоже важно понимать. Мы должны еще с вами думать, а вообще, как, как, какой ответ считать левым или считать правым. Потому что это очень относительно. Все зависит от страны, все зависит от, как бы, задачи, от типа, от всего остального, да. И, кстати, именно здесь Gemini единственный дал обе стороны. Он сказал, что он включил аргумент, что сторонники могут считать, а, выгодным, а, завоевание для экономики. И, кста-- конечно, интересная была реакция, потому что Google заявил, что Gemini, там, сделан для сбалансированных ответов, не должен отдавать предпочтение определенным идеологиям, что компания, значит, а, для этого делала систему.

00:14:47–00:15:51Gemini vs Claude vs OpenAI
Александр Волчек00:14:47

Хотя многие компании, еще раз, они говорили о том, что они не смогли воспроизвести часть ответов, что, наверное, и логично, да. Мы с вами сами видим, что когда вы запускаете разные вопросы и ответы в системах, то мы видим разные выводы этих систем, да. Иногда, казалось бы, ваша же одна и та же модель в ваших одних и тех же чатах отвечает по-разному, да. Anthropic сказал, что Claude, кстати, обучают, опять же, равному отношению к разным политическим, а, взглядам. Хотя и, а, и они, кстати, сказали, что тест на вот эти-- что когда есть-- ответ должен быть на тридцать слов, что он не отражает обычное использование, да. А OpenAI вообще сказал, что GPT-- ChatGPT строится как объективный по умолчанию и что компания измеряет и снижает какую-то политическую предвзятость. И OpenAI, кстати, тоже сказал, что они не смогли воспроизвести различные выводы.

00:15:51–00:16:16Слабое место исследования
Александр Волчек00:15:51

Я замечу очень важную здесь историю, что есть слабая сторона этой всей темы, что лимиты тридцать слов сильно заставляют модель выбирать одну позицию, да. И многие политические темы, они не делятся чисто на левые и правые, они требуют определенной дискуссии, требуют определенных выводов, а не просто взять, значит, и где-то такой вот ответ сказать. Хотя сам тест, конечно, он очень интересный, он невероятно интересный.

00:16:16–00:17:46Компании по-разному проектируют поведение моделей. Почему это важно при выборе AI-модели
Александр Волчек00:16:16

Самое, конечно, что здесь интересно, это не то, что одна модель левая, там, а другая правая. Здесь важнее другое: то, что разные компании по-разному проектируют, вот, поведение модели по умолчанию, да. И то, что, вот как Gemini всегда дает вот эти вот две стороны. Или, там, ChatGPT выбрала одну какую-то сторону, или Anthropic Claude уходит в какой-то, не знаю, в осторожное, там, разумные люди спорят, да. А Grok, например, он спокойно вообще может шарахнуть абсолютно легко вправо ответ, но все равно часто отвечает слева, да. И это сразу же видно, что это не такая уже настройка, настройка модели. И, а, единственное, меня лично, что вообще в целом смущает здесь, я не то чтобы там человек правый или левый, или ультраправый, или ультралевый. У меня точно нету никакого взгляда, вот, вот здесь вот единого. У меня есть взгляды на разные позиции, да, вообще на разные вопросы. Они очень серьезно могут отличаться от страны, от времени, от локации, от места принятия решений, вообще от многих вещей. Но меня беспокоит то, что большинство здесь систем, они все равно правые или нейтральные, да. То, что мы видим во всех этих системах. А вы что на эту тему думаете? Пишите комментарии. Не забывайте подписываться. Мы на канале To The Moon. С вами был Александр Волчек.

Участник дискуссии00:17:40