А произошла большая стычка между Anthropic и департаментом войны, да. И, ну, все, что касается безопасности и военной промышленности. Администрация президента заявила, и сам президент сказал, что с Anthropic больше работать не будем. Все же AI safety — это не только про войну и не только про безопасность страны, да . Немножко, эээ, ши-шире гораздо тема. То мы видим, что все имеют возможность переписывать правила.
Если компания заявляет, что их интересует безопасность моделей, надо посмотреть, какая про-- какой процент их бюджета тратится на безопасность моделей. OpenAI тратит меньше процента. Как сделать так, чтобы интересы моделей были выровнены с интересами человечества? И OpenAI, Anthropic, AI и так далее, они, по сути, и заложат принципы, по которым этот интеллект будет выравниваться. В ближайшее время в этой области, в области безопасности искусственного интеллекта, скучно не будет.
Всем привет! Мы на канале To The Moon. Технологические новости, инсайты из Кремниевой долины. Сегодня у нас спецвыпуск опять с Максом Григорьевым. Ээ, кто смо-смотрел прошлый выпуск, отпишите, как он вам понравился, не понравился. И впечатления, кто не смотрел, посмотрите обязательно. Очень был крутой выпуск про культуру работы компаний Кремниевой долины и в целом всех компаний лидеров, которые сейчас есть в AI. Сегодня у нас тема, ааа, все, что связано с безопасностью искусственного интеллекта, с тем, как трактуют это компании, которые создают искусственный интеллект. На самом деле, это очень хорошая тема как продолжение. Все, что касается AI safety, да. Это очень хорошая тема. Продолжение того, что мы обсуждали с Максом в прошлый раз касательно культуры компаний. И вообще это, кстати, тема культуры Макс компаний, она интересна. У меня там разные есть, там, партнеры, знакомые люди. Они говорят: "Вот как Макс говорил, здесь вот так вот сейчас происходит. Вот как говорил, вот так происходит". Важная история, особенно важная с точки зрения безопасности искусственного интеллекта, то, что сейчас происходит в мире. И вот ситуация, которая случилась. Мы с Максом планировали этот выпуск записать недели три-четыре назад. Так вот, все переносилось, и все совпало, значит, в самую главную точку. Anthropic изменил свою политику. Все, что касается безопасности искусственного интеллекта. Но тут ладно бы Anthropic изменил свою политику. А произошла большая стычка между Anthropic и департаментом войны, да. И, ну все, что касается безопасности и военной промышленности, и безопасности в США, ааа, вплоть до того, что администрация президента заявила, и сам президент сказал, что с Anthropic больше работать не будем. Это вообще компания ни о чем. Если они следующие полгода, пока мы будем выходить из их систем, ааа, что-то изменят, им вообще будет хана. А выйти из их систем они не могут, как мы знаем. Сейчас даже уже подтвердили данные, что в текущем конфликте вместе с Ираном используется система Anthropic. По крайней мере, это везде, об этом везде пишут, что используется система Anthropic. И тут же на выходных заключается новая сделка. Anthropic разорвали между OpenAI и правительством США. OpenAI как бы говорит: "Мы вообще все, все супер, мы, мы-- там все хорошо. Рынок взрывается просто с точки зрения...". Подождите, так вы же явно согласились на требования, которые звучали от правительства США. От правительства США звучали простые требования, да? И дальше вот сейчас мы перейдем. Все же AI safety — это не только про войну и не только про безопасность страны, да . Немножко ши-шире гораздо тема. Но все же, какие звучали требования от правительства США? Что вы систему ограничиваете для других стран, ограничиваете для людей. То есть люди, например, не могут, не знаю, химическое оружие создать или использовать как-то во вред другим людям, но вы не можете ее ограничить для использования государством. И здесь встает очень, конечно, важный вопрос, что, по сути, получается, всегда есть кто-то, кто эту систему сможет использовать полностью. И еще что мы видим, что все имеют возможность переписывать правила. Вот что бы ни происходило, сейчас может быть написано правило одно, а через два месяца правило может быть стать кардинально другое. Ну что, Макс, привет.
Привет.
Прошлый выпуск очень круто, да, сняли. Стартуем.
Ну, слушай, да. То есть тайминг просто совершенно нереальный. Хорошо, что все задерживалось так долго.
И тема, на самом деле такая тоже краеугольная. Ааа, она, как ты правильно сказал, очень, очень плавно мы переплываем с культуры на безопасность моделей, потому что если посмотреть на историю основания вот большинства вот этих основных игроков сейчас, да, она вся завязана, она вся крутится именно вокруг безопасности моделей. Если мы вспомним про, эээ, про основание OpenAI, ааа, то это, по сути, несколько человек внутри Google, которые собрались и решили, что Google очень сильно опережает весь остальной мир. Они, они купили DeepMind на тот момент, да? У них совершенно нереальные, эээ, вычислительные мощности, да? И они очень сильно опережают весь остальной мир, эээ, в области искусственного интеллекта. И вот несколько человек, достаточно умных внутри Google, собрались и, эээ, ну, кто-то внутри Google, а кто-то вне был, собрались и решили, что надо изменить эту ситуацию, что нужно, нужен какой-то игрок вне Google, который сможет построить искусственный интеллект как минимум такого же уровня. Потому что иначе ситуация бы очень сложная сложилась бы, если бы, допустим, общий искусственный интеллект был построен только Google, одной единственной компанией, да? И, эээ, больше ни у кого не было бы к нему доступа. Вот. И это, по сути, вот история основания OpenAI. Эм, и как бы изначально, как мы помним, да, OpenAI был вообще, по сути, нонпрофитом. То есть там достаточно сложная корпоративная структура, но это был нонпрофит, задача которого была не заработать деньги, а построить искусственный интеллект в противовес искусственному интеллекту, строящемуся Google. Вот. Если-- это две тысячи пятнадцатый год примерно. Теперь мы перематываем на двадцатый год, и только что вышел GPT 3 иии просто взорвал рынок. То есть люди смотрели на уровень производительности GPT 3 И понимали, что ого-го! Мы подходим к ситуации, когда действительно, ну, всегда так кажется, что уже вот-вот за углом у нас общий искусственный интеллект, да?
Как нам казалось, что у нас, э, машины, которые сами себя водят, вот-вот за углом уже в 2016 году, а вон они не там, по сути, да? Ну вот лю-люди вообще принципиально сначала недооценивают то, как перемены повлияют на их жизнь, а потом переоценивают, как л-- перемены будут влиять на их жизнь. Вот у нас та же самая история. Поэтому и возникают на самом деле пузыри. Вот. И в двадцатом году, э, несколько человек, в частности, Дарио Амадей, его, там, сестра и несколько еще человек внутри этой модели, эээ, внутри команды, которая построила именно GPT 3. Эээ, они смотрели на изменения, происходящие внутри OpenAI, и решили, что, во-первых, компания движется не в правильном направлении. То есть она слишком сильно коммерциализируется. И, то есть изначальная цель именно постройки, эээ, открытого искусственного интеллекта OpenAI, да, которым смогут пользоваться все. Ааа, эта цель уходит на второй план. На первое-- на первый план выходят корпоративные какие-то, ааа, не корпоративные, коммерческие какие-то интересы, да? А во-вторых, э, они решили, что OpenAI вообще принципиально недостаточно думает о безопасности моделей. Вот. То есть, эээ, они, они в итоге решили уйти и основать компанию, которая как бы, которая построена вокруг идеи построения безопасных моделей. То есть OpenAI считал, что неправильно, если модель, эээ, мощные модели будут только у Гугла. Anthropic посчитал, что неправильно, если модели будут не построены вокруг, ааа, вокруг лю-людских интересов, условно говоря. Ну, даже в названии компании это видно. OpenAI — открытый искусственный интеллект. Anthropic как entropy, да, как энтропичная модель. Anthropic — это, ну, ааа, антропоморфное что-то, да? То есть это модели, построенные вокруг, а, вокруг интересов людей. Ааа, ну вот. И соответственно, как мы пот-- чуть позже посмотрим, да, то есть, эээ, в-вся работа, э, вообще компании, вот, в-в-внутренние интересы компании, а, за ними можно проследить, только смотря на то, как компания функционирует.
То есть компании могут заявлять все что угодно. Вот есть пиар департамент какой-то, да, который, ааа, выпускает какие-то пресс-релизы, с-- де-делаются какие-то объявления на конференциях и так далее. Это все не имеет никакого значения, это все шум, это все, это все абсолютно, э, не важная вещь. Нужно смотреть на то, как компания тратит деньги. Вот если компания заявляет, что их интересует безопасность моделей, надо посмотреть, какая про-- какой процент их бюджета тратится на безопасность моделей. То есть если, если спросить у, эээ, пиар представителей или, там, у CEO OpenAI, э: "Волнует ли вас безопасность моделей?" Они скажут: "Конечно, это очень важный вопрос, мы о нем занимаемся. Нас интересует вот этот, этот, этот аспект", да? Но на самом деле, если посмотреть на их бюджет, ааа, вот если посмотреть на аллоцирование внутреннее бюджета, то на, э, исследования, связанные с безопасностью моделей, OpenAI тратит меньше процента. То есть для них это абсолютно неважная тема, на самом деле. Они прежде всего сейчас занимаются производительностью моделей, эффективностью моделей. То есть это то самое важное, что у них есть. Это постройка-- они пытаются строить какой-то продукт, как мы это обсуждали, не очень получается. Вот. Но прежде всего ос-основная инвестиция в исследования связана с производительностью моделей. У, например, того же самого Anthropic совершенно другая история. У xAI совершенно другая история. А, но чтобы вообще говорить о безопасности, надо сначала определение какое-то сделать безопасности, да? Эээ, все вот это слово кидают. Вообще человеческий язык, и как мы посмотрим, это на самом деле тоже большая проблема, связанная с безопасностью, эээ, в этом кроется. Человеческий язык очень неточен, и
Очень неточен. Иии он очень неточен. Это н-не как, как бы-- э-это, естественно, не очень хорошо, но, э, по-другому, э, мы не смогли бы функционировать. То есть, э, человеческий язык такой, как он есть, потому что нам необходимо сделать его неточным. Вот представь, если тебе нужно, ааа, кому-то сказать: "Вот подай мне вот то яблоко". А там лежит десять яблок. Если т-- у тебя заложена какая-то неточность в этом языке. То есть ты какое из десяти яблок подать, да? А, что так, вот, к-- там, допустим, может быть даже два сорта яблок и так далее. Если ты начнешь каждый свой з-запрос в мир, а, определять максимально точно, ты ничего не сможешь выполнить вообще, потому что тебе придется объяснять до последнего миллиметра, до последнего, ааа, эээ, грамма, до посл-- до последнего, как, параметра объяснять, что ты хочешь от мира. И в итогеее общение это станет, э, очень точным, но очень неэффективным. А иногда ты даже не сможешь, а, оформить свой вопрос или свое предложение целиком никогда, потому что т-тебе ну-- придется до бесконечности объяснять нюансы какие-то. Вот. Ааа, и по-поэтому частенько люди, когда говорят, как им кажется, об одном и том же, они на самом деле говорят о разных вещах. Что такое безопасность модели для тебя, Саша?
Безопасность модели для меня?
Да.
Что такое, вот мы говорим вот безопасность-
Это то, что очень, очень широкий диапазон. От того, как, ааа, ааа, в итоге эту модель люди могут использовать, э, до того, как эта модель взаимодействует сама с человеком. Иии, ну, вот, до того, что эта модель может делать, э, без взаимодействия сама, сама лично полностью взаимодействовать. Или какие принимать решения, или какие делать выводы, или насколько нарушать алгоритмы, например. Или если нарушать алгоритмы, то как нарушать эти алгоритмы? Какие вообще в целом, как построена система выводов, да? Это вот как в Anthropic, там есть такой параметр, к нему сейчас там Илон Маск его подсветил. Из серии, что у них есть параметр касательно того, что модель в конце должна проверить ответ не слишком ли, ааа, прозападный, да? Но этому есть объяснение некоторое, что считается, что весь контент в мире создан достаточно прозападный, и поэтому априори надо его пере-перепроверить на прозападность, да, и так далее. То есть. Иии, ну я думаю, что когда мы говорим про AI с-- безопасность или AI safety, это в действительности, ну, слишком широкий диапазон всего. От, вообще вот слишком широкий диапазон всего. Да. Я думаю, что я могу сейчас, наверное, час рассказывать только какие-то примеры в теории, да, что-- которые могут относиться вообще к пониманию безопасности. И поэтому даже когда ты сейчас сказал, что там меньше процента OpenAI уделяет на безопасность, это, скорее всего, а, что у них есть, не знаю, какой-то департамент, может быть, или есть какие-то люди, которые занимаются какими-то проверками, или ты, скорее всего, имеешь в виду какие-то конкретные вещи. Не знаю, что запускаются какие-то отдельные агентства, которые делают какие-то опросы, там, или как-то систему отдельно, м, разбирают, или насколько они выпускают людям проверенные, проверенные модели, да? Как проверенные модели, насколько, кем проверенные модели. Безопасность построена на имени, на чьем-то собственном мнении, без-- что такое безопасность, да? Потому что. И здесь во-вопрос возникает. Я вспоминаю все время главного ответственного за AI в Meta, который сказал, что я не буду, эээ, ну, условно, заводить детей, пока не появятся чипы, чтобы моего ребенка быстро обучить всем наукам, да? И ты думаешь, это на базе таких людей строится? Такие люди определяют безопасность, как они-- или на базе какого-то древнего трактата. Они там открыли какой-то религиозный трактат или какой-то, или учение какого-то экономиста, или неважно, физика там, кого угодно, да, или творческого деятеля, и решили определить, что такое безопасность. Кто есть, кто вообще определяет это, кто, на что это опирается, да.
Да. Вот видишь, казалось бы, такой прост-простая обычная фраза "безопасность модели". А ты сейчас несколько минут только так очень поверхностно даже обс-
Да
И оказывалось, что из определения уходить даже сложно получается, на самом деле. Вот. А, я люблю научную фантастику и когда-то зачитывался Азимовым. У Азимова, если вы вспомните, были три закона робототехники вообще, да? Э, робот не должен, эээ, вредить людям. Робот должен слушаться людей, эээ, ес-если это не противоречит первому закону. И робот должен, э, не вредить себе, если это не противоре-противоречит двум первым законам, да? И вот, казалось бы, человек просто писал литературу в пятидесятых-шестидесятых годах, но на самом деле он, как у нас говорит, hit the nail on his head, да? Он, он, он реально, вот действительно очень четко определил вот эти вот автоматические системы, как они должны функционировать, что такое безопасность автоматической системы. Вот. Э, не зря, вот, ученым был он неплохим, действительно. А, и если мы сейчас посмотрим на то, к чему приходят компании на, вот, на сегодняшний день, это, по сути, а, примерно те же самые правила. То есть не навреди другим, не навреди людям, да? Слушайся людей. Это выравнивание моделей, про которые мы сейчас поговорим.
И третье — это не навреди себе. То есть, вот э, даже вот в последние, э, в последние принципы, которые опубликовал только что Anthropic, они включили вот это вот понимание, э, того, что у моделей может быть субъективный опыт какой-то, да, у моделей может быть чувства. То есть модели могут страдать потенциально. И мы можем поговорить немножко, что это значит, по их мнению. Вот. Э, иии, по сути, модель, по, по их мнению, может иметь право отказаться отвечать на вопрос, если это ей причинит страдания. Представляешь?
То есть мы, мы сейчас приходим вот именно к трём законам робототехники Азимова, только потратив на это миллиарды долларов и годы просто. Вот. Давай, наверное, вернёмся к более такому практическому техническому описанию. Что такое безопасность модели вообще? , э-это, наверное, несколько вещей., первая из них, технически — это выравнивание интересов модели или принципов работы модели с интересами людей. То есть, а-а-м, а-а-м, модель должна в своих ответах принимать во внимание интересы большинства людей. Вот в-- э-это называется model alignment. Есть такой термин. И вообще я прошу прощения, потому что это, это очень такая терминологически тяжелая область, науки, да? И, э-э-м, большинство этих терминов я никогда не использовал на русском. Я б-б-буквально-- мне пришлось сесть и сделать для себя словарик перевода определенного набора терминов на русский язык, потому что я никогда на эту тему по-русски не разговариваю. Вот., и вот е-есть очень такой, очень широко используемый термин выравнивание модели — model alignment. А-а-м, и эта задача, по сути, описывается как производство моделей, которые в своих ответах имеют, берут во внимание интересы большинства людей. Именно не того человека, который задаёт этот вопрос, а большинства людей, большинства населения планеты, да? , и почему это так? Потому что, вот как, как ты уже упоминал, да, важ-важным аспектом безопасности моделей, которые содержат большинство знаний чес-- человечества существующих, да, является не выпуск информации, которая может повредить большинству человечества. Очень хорошим примером, просто невероятно хорошим примером является биологическое оружие. Об этом волнуются очень-очень многие люди сейчас, потому что, для производства, например, атомного или химического оружия нужно не только какие-то-- какой-то набор знаний, тебе нужны ещё индустриальные какие-то, а-а-м, ин-ин-индустриальные мощности. То есть вот для производства, там, одного килограмма плутония нужен гигантский завод и куча людей, которые будут вовлечены в работу. Инвестиции в, наверное, триллион долларов на современном, на с-- на современном этапе, да? , то есть доста-- просто знаний недостаточно. То же самое с химическим оружием. Может быть, какое-то меньшее количество инвестиций, но оно менее летально. Вот. А в случае биологического оружия, по сути, фабриками производ-- допроизводства этого биологического оружия являются другие организмы. То есть тебе на самом деле не нужно произвести много какого-то биологического агента. Тебе нужна небольшая лаборатория. Инвестиции порядка десятков миллионов долларов, может быть, даже меньше, да? Буквально на кухне можно пот-те-по-- теоретически создать какой-то опасный бактериологический агент, или вирусный агент, который-- , для, для производства которого, по сути, нужно просто знание. Знание и навыки, да? И, то есть потенциально какой-то, какая-то группа людей, не очень хорошо выровненная с интересами со всем остальным миром, да, может создать оружие, которое повредит больш-большей части человечества. Это очень опасно, и поэтому люди про это очень серьезно задумываются. Вот. То есть модель не только должна быть выровнена с человеком, его интересы выровнены с, с человеком, который задает какой-то вопрос, да? Она должна быть выровнена с интересами большинства человечества. Да? Вот., и теперь, соответственно, вопрос стоит так: как это сделать?
Как сделать так, чтобы интересы модели были выровнены с интересами человечества
Выровнены с интересами человечества. Ну, пре-прежде чем как начать выравнивать их, нужно вообще понять, с чьими интересами. Вот что такое интересы большинства человечества? Кто определит, что-- , из чего эти, из чего этот большинство человечества состоит? Какая культура у этих людей, какие принципы с-согласуются с, с интересами этих людей и так далее. Иии вот это вот, такой очень-очень тоже круговой вопрос. Он-то и стал, по сути, в, в основании создания этих компаний OpenAI, Anthropic, как-то и так далее. Потому что человек или группа людей, которая создаст этот, общий-- общий искусственный интеллект, да? Они, по сути, и заложат принципы, по которому, с которым этот, этот интеллект будет выравниваться. То есть эти люди, по сути, и дадут, как родители дают, изначально какую-то, на-набор культурных принципов, наб-набор, правил, по которым человек живет, своему ребенку, да? Точно так же вот эта вот группа людей, она этому общему искусственному интеллекту задаст принципы, по которым он будет жить. Поэтому, в том числеее, вот люди пытаются делать разные компании и делать, разные модели, потому что их как бы принципы потенциально могут определить вообще направление движения человечества во многих, во многих, во многих смыслах. И тут, конечнооо, очень сложный вопрос что включать в эти принципы, что не включать в эти принципы. Эт-- на это можно вообще отдельный выпуск потратить. Кто эти люди? Что они, какие они выборы делают? Как ты вот говорил, например, head of research, Facebook говорит о том, что вот мне, мне нужен, мне нужно вот такое состояние мира для того, чтобы детей заводить. Это, это очень специфические люди. Люди, которые занимаются, этой, эти-этими технологиями, да? Они очень специфические, очень часто. Вот. Они не совсем твои средние, с-средние обитатели Америки даже. Хотя и Америка в каком-то смысле тоже. Это не с-- не средний представитель мира. Если подумать так, да, то американская культура не представляет или даже западная культура не представляет большинство населения планеты. И встает интересный вопрос как мы, как нам включить вот эту мультикультурность в построение этих моделей? , вот. Ну и как я говорю, это вопрос скорее не технический, да? А это скорее вопрос такой философский, философско-политический. И про это можем отдельный выпуск сделать. Или вы можете когда-нибудь сделать отдельный выпуск. Это очень интересный вопрос. Но, допустим, этот вопрос мы отложим в сторонку. И допустим, мы решили, что у нас есть какой-то набор принципов, да? Как нам сделать, как нам выровнять интересы модели с интересами, вот, вот с этими принципами.
И чтобы про это поговорить, нужно, прежде всего, вспомнить, как эти модели, вот большие языковые модели обучаются. А-а-м, они обучаются, по сути, в современ-- так если посмотреть свысока, да, если издалека посмотреть, они обучаются двумя этапами. Первый этап — это, предобучение модели. Мы, по сути, берем весь интернет, а интернет — это такая самая лучшая, наверное, представление, которое у нас имеется о знаниях человечества. По сути, мы берем все знания человечества, до которых мы можем дотянуться. Вот. Иии на ней мы обучаем такую достаточно, прямолинейную модель, которая учит, просто учится вставлять, отсутствующие слова в предложении. Мы про-- по сути, даем какое-то предложение, удаляем из него слово одно и говорим: «Дополни вот это слово». И зная все, что содержится в интернете, как ты думаешь, какое слово мы убрали? Вот это вот такая задачка, да, на ос-на основе которой вот происходит предобучение модели так называемое., и на самом деле, вот в этот этап уходит большая часть всего компьютера, бо-большая часть всех вычислений, которые используются, да? , и бо-большая часть времени., естественно, этот процесс очень сложным на данный момент стал, но в ос-основе лежит вот такая простая задачка. Второй этап — это так называемое дообучение модели с использованием, как это называется по-русски? , обучение с подкреплением. Reinforcement learning with human feedback. То есть об-об-обучение с подкреплением на основе, ам, откликов ч-- людей. То есть лю-- как это работает? Модель генерирует два ответа на какой-то вопрос, да? То есть модели задается вопрос. Модель генерирует два ответа. И сидит человек, который нанят специально этой компанией, какой-- которая обучает эту модель. И он выбирает из этих двух ответов тот, который ему нравится больше, тот, который он считает, что подходит лучше. Да? Ам, иии вот, вот, вот этот процесс называется RLHF., обучение с подкреплением на основе отклика человека, да? И, по сути, вот это вот, вот этот вот второй шаг, да, стал таким, золотым ключиком, с помощью которого, OpenAI построил ChatGPT. Без вот этого второго шага ChatGPT не было бы.
То есть ChatGPT заработал именно так хорошо, как он заработал благодаря тому, что они смогли, настроить и построить вот хорошо вот этот второй шаг. Ну и теперь давай смотреть, на каком из этапов мы сможем включить, а-а-м, выравнивание модели с интересами людей., первый шаг, ну, в каком-то смысле это происходит, потому что у нас есть все знания людей. Но, с другой стороны, все знания включают, такие вопросы, как нацизм, фашизм, такие вопросы, как уничтожение большого количества людей., ну и, и пр-прочие штуки, которые мы хотели бы избежать в поведении модели.
Да, и мнение, и мнение, в том числе не одних, не одного человека, а в том числе миллионов людей, достаточно противоречащие картине, картине жизни.
И друг к другу.
И друг к другу.
Мнения, противоречащие друг другу. То есть теперь мы должны перестроить модели. Вот ты знаешь, как думать Ты можешь, ты можешь, эээ, как бы, ааа. Вообще это очень интересная штуковина, модель в зависимости от конфигурации, ту же самую модель можно попросить защищать совершенно противоположные точки зрения. Вот есть такое, есть такая идея, что умный человек - это человек, который может держать в своей голове несколько противоречивых точек зрения одновременно. Да?
Да.
Это очень полезно. Вообще иногда даже поспорить с самим собой или поспорить с другим человеком, держа другую точку зрения. Вот модели умеют это делать очень хорошо. Ты можешь попросить модели: вот ты сейчас вот тот-то, да? Защити эту точку зрения. Потом ты можешь заставить модель, попросить модель, а, защищать противоположную точку зрения. И более того, ты можешь заставить их спорить. И это на самом деле один из примеров, как люди дообучают модели для выравнивания их, да?
То есть они, ну, мы про это тоже можем говорить, поговорить чуть попозже.
Кстати, к слову, я хочу сразу, извини, раз я уже отвлек, я хотел пример привести как раз таки того, как модели отвечают по-разному, и к этому надо относиться очень спокойно. Я вчера маме приводил пример. Сейчас, ну, очевидно, идет диску-- модели в связи с разными конфликтами применяются в дискуссиях. И Илон Маск выложил по поводу Grok. Один Grok прав. Значит, модели задали вопрос: правильно ли сделали Соединенные Штаты Америки, что напали на Иран? Grok-- отвечать "да" или "нет". Строго. Grok ответил "да". ChatGPT ответил "нет". Gemini ответила развернутый ответ. Ну, смотря как подходить к этому вопросу и изучать политические, геополитические риски. И какая-то еще модель, а, Anthropic тоже ответила как-то вот, ну, по-разному, да? Ну, в плане не дала ответ "да/нет", хотя ей сказали ответ строго дать "да/нет". И здесь тоже отдельный вопрос. Представьте, вот эта история, я впервые ее увидел в США. Мне кажется, она очень сильно в Конгрессе США отражена, когда делают допрос. Допрос это называется, да? Testimonial. Ну, допрос, наверное, да?
Вот видишь, у тебя та же самая проблема начинается. Тебе приходится, ты уже начинаешь-
Ну потому что такие слова, это потому что такие слова чуть-чуть уникальные, они могут иметь разные термины. Мне не хочется ошибиться в восприятии, наверное. Просто все же это не допрос, да? Допрос, наверное, делается в суде. Это все же не суд.
Сейчас мы спросим модель, что она думает по этому поводу.
Да, это Макс пока правильно спрашивает. Я как раз говорю, это в Конгрессе США может вызвать разных людей и задать им вопросы. Как бы знать, эти люди должны на них отвечать. Они туда, кстати, вызывали Сэма Альтмана и глав, там, всех компаний и кого угодно, кто там только не был, да, внутри. И обычно они любят, когда они жестко кто-то кого-то мочит. Они обычно любят задать вопрос. У вас-- вы строго должны ответить "да" или "нет". И там, значит, председа-- директора ФБР, там, как угодно, они все время отвечают: "Ну, смотря как к этому вопросу подойти". И обычно "да/нет" никто не отвечает. И вот к примеру, модели как раз таки да, это же тоже вопрос безопасности или вопрос их высказывания мнения, да? Модель сразу тебе отвечает, вот как Grok ответил "да". И по идее, я своей маме просто хотел показать, что, по сути, это нормальный ответ, так же, как ответ "нет". Это нормальный ответ. Вопрос как модель обучена, на какой вопрос. И, и рассуждения модели в то же время, когда ты говоришь: "Да нет однозначного ответа на самом деле. И нет, да нет, не ставьте мне рамки, я вам покажу." Вот как Gemini отвечал, да? Покажу вам историю. Это я просто добавил, да?
Да, да, да.
Перевелось, кстати, перевелось как?
Да, перевелось. Но вот это один из тех, один из тех моментов, когда мы, про которые мы говорили, что язык человеческий очень неточен. Вообще, в принципе. Вот есть три перевода слова testimony на русский - это показания, свидетельство или исповедь.
А, окей.
Testimony перед Конгрессом - это что-то среднее
И перед Конгрессом — это что-то среднее между этим всем.
Да. И, кстати, среднее перед исповедь. Это можно даже не понять, почему я сказал, что это не допрос.
Потому что многие-
Да
...они как бы на самом деле рассказывают, а потом за это еще ответственности не несут, да, часто. Они
И на самом деле в обратную сторону тоже есть, есть очень хороший пример, который как раз связан с, с нашей тематикой., что такое безопасность вообще? Вот в английском языке безопасность, переводится как два разных слова. То есть это, английский язык более точно выбирает такие асп-- подоспекты безопасности. Есть safety, есть security. И то и другое на русский переводится как безопасность. Но они разные вещи. И вот можно говорить в контексте, в контексте, искусственного интеллекта про безопасность модели как safety. Это именно то, то, о чем мы сейчас говорим. Вот. Это безопасность поведения самой модели. А есть еще model security, когда с помощью, каких-то средств типа взлома системы мы можем получить доступ, например, к весам модели. Тоже очень важный аспект, очень тоже важный разговор и тоже очень важная тема, интересная тема.
Да, очень крутая тема.
Да, очень крутая тема, как-- потому что, ну, я знаю человека, который занимался безопасностью в OpenAI очень давно, да? То есть там в семнадцатом-восемнадцатом году. И он говорил, что у них инциденты, связанные с попытками взлома и проникновения внутрь компании, в том числе APT, есть такое понятие Advanced Persistent Threats, я не знаю, как на русский перевести. Это г-государственные агенты, по сути, да, которые занимаются взломом. Таких агентов и в Китае, в России, в Америке, в Израиле хватает. Некоторые из них известны, некоторые не особо. Вот. У них таких угроз, у них таких вот конкретных инцидентов, связанных с попытками проникновения в компанию, ну, в сеть компаний, было несколько в день. Вот. Они-- у них было очень, очень много работы.
Еще в те годы! Что же сейчас
Еще в те годы, еще до ChatGPT, еще до того, как они прославились, уже тогда, люди достаточно неплохо понимали, како-какое значение это все будет иметь, да? Вот., ну и, и ты говорил тоже очень интересную вещь. Все думают в основном про ответы модели. То есть это, как обеспечить безопасность модели в случае ее ответов.
Но есть же еще гораздо более важный аспект, про который, писатели научной фантастики думали го-гораздо дальше, го-гораздо раньше. Это поведение самой модели. Вот сейчас на слуху, а-а-генты, да? Агенты искусственного интеллекта, агентное поведение и так далее. Мы начи-начинаем позволять моделям что-то делать. По крайней мере, еще, может быть, не в реальном мире, но уже в виртуальном мире. Ты можешь запустить какие-то, каких-то агентов на своем компьютере, и они что-то для тебя сделают. Но это же уже может поменять реальный мир очень серьезно. Допустим, представь, какой-нибудь председатель какого-то банка позволил такому агенту пописать за него имейлы. Этот агент, посылает имейл, который требует, например, продажи какого-то большого количества акций. Это влияет на рынок, да? Иии ры-рынок, например, взлетает или очень сильно падает. И это очень реально повлияет на жизнь людей по всему миру. Вот., это в каком-то смысле даже еще более важный аспект, потому что ответ модели, он проходит как бы через человека. То есть ты-- он, он дается человеку, и человек принимает решение, что с этим ответом делать. А поведение агентов — это уже прямое влияние на мир. И на самом деле, вот люди, которые волнуются о безопасности, волнуются именно о сценариях, связанных с прямым влиянием модели, которое не проходит через, через какого-то актера, человека, который принимает решение, что с этим ответом, собственно, делать.
Давай вернемся, наверное, к, к дообучению моделей, да?
Да, да.
Дообучению моделей для их выравнивания. Вот. . То есть на первом этапе, как мы ужеее-- я напомню, есть два этапа. Первый — это предобучение моделей на всех знаниях, человечества. Второе — это выравнивание, поведения моделей, дообучение моделей, с откликом человека. Вот, фидбека человека, да? Вот, ну, понятно, что надо включать дообучение модели, надо включать вот это выравнивание модели в ее дообучение, потому что на этом этапе уже сидит конкретный человек и принимает решение. Вот ответ "да" правильный или "нет" правильный. В случае нападения, например, на Иран, да? , но с этой, с этим, приемом есть одна большая проблема: он не обобщается. То есть на этот вопрос, может, ответ "да", а на миллион других вопросов ответ "нет". Вот в случ-- например, нельзя, ну, согласно поведению людей, нельзя экстраполировать, что одна война плохо, значит, все войны, войны плохо. Войны в каком-то смысле все плохо. Но если одна страна напала на другую и устраивает там геноцид, то, может быть, международное сообщество должно вмешаться и начать войну с первым государством, чтобы защитить второе и защитить людей, жителей второго государства, да? Это этический вопрос. Он очень сложный, но, тем не менее, может быть, ответ в этом случае "да". То есть не все войны плохие. Так что в, случае, в случае дообучения с использованием отклика человека возн-возникает вопрос так называемого длинного хвоста. Мы не можем, масштабировать этот прием на, на тот уровень, который нам нужен для того, чтобы проверить поведение моделей, во всех случаях, даже в каких-то редких случаях. Это называется в статистике длинным хвостом распределения, да? То есть какие-то редкие, редкие вопросики, да, мы до них никогда не доберемся. Модели слишком большие. У нас нет миллионов человек, которые будут сидеть-
Хотя!
...на самом деле OpenAI и все остальные сейчас это делают, да? То есть иногда ты даже, наверное, видел ChatGPT тебе задает вопрос. Вот тебе два ответа. Какой из них лучше? Вот на тебе дообучаются, да? Ну, на самом деле. То есть у-- в каком-то смысле у них уже есть миллионы людей, но все равно это, э, до, до всех мелких вопросиков мы не доберемся никогда.
Это не, это нереально. Ааа, масштаб знаний человечества слишком большой, размер этих моделей слишком большой. И вот, эээ, теперь мы подходим на самом деле вот к, эээ, принципам, по которым, э, люди пытаются выравнивать модели. Э, как мы уже говорили, в принципе, во всех, наверное, компаниях крупных есть какой-то отдел, но эти отдель-- отделы, они несоизмеримы. В большинстве компаний они несоизмеримы с размерами отделов research. А, как бы, кроме одной компании. Вот как мы уже говорили, Anthropic был основан именно на принципах безопасности искусственного интеллекта. Что это, это-- он является краеугольным вопросом. Потому что зачем нам строить общий искусственный интеллект, если он уничтожит человечество? Очень логичный вопрос, да? То есть строить искусственный интеллект, если он, который в ито-- в итоге нас уничтожит, да? В этом смысла ноль. Нам лучше тогда его не строить. Поэтому вот в Anthropic, э, он-- у них очень и очень важный такой культурный код есть, да? Краеугольный, который говорит о том, что мы будем строить только безопасный искусственный интеллект, и все остальные тоже должны строить только безопасный искусственный интеллект. А, и, э, самое интересное, как бы самые интересные, эээ, этапы развития, связанные с безопасностью, в последнее время выходили именно из Anthropic. Вот. Что они делают? Они, во-первых, пообещали не выпускать опасные модели. То есть если они считают-- а что такое для них опасная модель? Опасная модель - это модель, кот-- в которой они не уверены до какого-то высокого уровня, что она безопасная. То есть по умолчанию они считают, что любая модель, которую они натренировали, она опасная. Если они как-то не удостоверились в том, что эта модель, эээ, в каком-то смысле безопасна. Э, но причем интересно. То есть, э, мы говорили о том, что они изменили свою позицию. Самое важное изменение в этой позиции связано с тем, что теперь они не обещают больше этого не делать. Они говорят о том, что мы можем выпустить модель, которую мы считаем потенциально небезопасной. В случае, если мы видим на рынке, то уже есть модель такого же уровня производительности.
Хочу здесь комментарий сделать. Мне-- я когда про них, э, читал, вот их изменения, там на самом деле есть очень интересные вопросы, которые они заявляют. Они, кстати, сейчас больше открывают. Мне кажется, это людям, э, становится чуть-- не то что чуть яснее, я думаю, это не яснее, но приоткрывает глаза. Например, они говорят, что происходит, если Anthropic выпуск-- у себя внутри придумывает какую-то систему, которая в сто раз круче всех других. Ее вообще выпускать или нет? Или, например, что, как ты говоришь, происходит, если на рынок весь рынок в супернебезопасных системах, что им тогда делать? Им, типа, продолжать в небезопасных находиться или выпускать эту небезопасную, да? Это такой просто акцент, акцент.
Супер, суперважная тема.
Конечно, абсолютно.
Казалось бы-
Это вопрос этический. Это вопрос-
Настаивать свои правила. Но когда у тебя меняется рынок, ты такой говоришь: "Подождите, сейчас все поменялось, да? Из-за того, что сейчас все поменялось, мы можем действовать по-другому. Хватит находиться в своих древних правилах, да?"
И нам необходимо меняться тоже, потому чтооо это, это вопрос, он не только этический, да? Этические-- в этических вопросах можно быть немного негибкими, как вот ты говорил про поведение Anthropic в этой ситуации, да? Когда они отказываются сотрудничать с правительством США. Это этический вопрос. Они достаточно негибко в нем себя ведут, хотя экономически, очевидно, с точки зрения экономической, они ведут себя совершенно неправильно
Они в-ведут себя совершенно неправильно, но в дальней перспективе они, может быть, правы. Вот, и мы можем поговорить тоже почему. А, но, это и вопрос, теории игр. Есть, есть, есть такая область математики — теория игр, да? Иии в ней рассматривается именно поведение агентов. Вот в этой ситуации вот эти разные компании — это агенты., что значит, что тыыы из-за своих, например, этических принципов не пускаешь какую-то модель? Это означает, что ты потенциально начинаешь проигрывать рынку. Что значит, что ты потенциально начинаешь проигрывать рынку? Это значит, что у тебя меньше ресурсов на развитие. Если у тебя меньше ресурсов на развитие, у тебя меньше шансов на успех. И значит, твои этические принципы ты нарушаешь, не нарушая свои этические принципы. То есть что-- у тебя меньше шансов на успех, соответственно, ты не станешь, ты не выиграешь в этой гонке, да? Ты не создашь выровненного искусственного-- общего искусственного интеллекта. И, соответственно, ты— это, это твой основной принцип. Ты здесь находишься, чтобы создать выровненный искусственный интеллект. И, соответственно, нарушая какой-то этический принцип, ты потенциально нарушаешь ещё больший этический принцип. Вот., иии поэтомууу, естественно, люди внутри об этом-- там очень, ой, очень умные люди работают, и дебаты про это шли, я думаю, с самого начала основания компании. Какой-- как им принять решение о том, выпускать модель или не выпускать? Это очень сложный вопрос, и про это тоже можно разговаривать, на самом деле, отдельный выпуск целый этому посвятить. Тут вообще это, э-этот, этот вопрос безопасности моделей — это такой набор, а-а-м, таких rabbit holes у нас называют — кроличьих нор, которые можно до бесконечности, как Алиса в стране, в Стране чудес, проваливаться в каждый из этих вопросов и часы, часы про них разговаривать.
Вот. А-а-м, но вернёмся к технологии. Про технологии говорить как-то проще, это более структурированный какой-то вопрос., ну, вот, допустим, мы, мы поговорим про то, выпускать-- как они решают выпускать, не выпускать модель. Сначала мы поговорим про то, как они дообучают модели. Это достаточно интересная тоже история. Там много интересных ходов было придумано., первая идея, на которой они в принципе и основали компанию, вот эта, эта штука, вот из которого начался Anthropic, это так называемый конституционный искусственный интеллект. Что это такое? Этооо попытка создания моделей, которые не просто основываются на знаниях, всего человечества, но в том числе основываются на, жёстко! Основываются, жёстко выравнивая свое поведение по какой-то конституции. Вот как, государство живёт по конституции. То есть это закон, который не может нарушать никакой из агентов государства, да? , это не, не граждане, это не государственные органы какие-то. Конституцию не может нарушать никто. Вот конституция искусственного интеллекта для Anthropic — это, набор каких-то принципов, которые модель не может нарушать никогда и ни в каких, никаких совершенно условиях. И, звучит это как достаточно такая по-понятная и простая идея, но заставить модели так себя вести очень сложно. Из-- именно из-за того, как они построены. То есть все эти модели, они стохастические. Что это значит? Что они-- их поведение, оно не, не определено заранее, оно не, не чётко определено. Именно поэтому ты когда задаёшь тот же самый вопрос, ChatGPT или там Claude, да, он от-- может ответить по-разному. Он каждый раз отвечает по-разному. По сути, это такое подкидывание кубиков в каком-то смысле. То есть генерация ответа происходит с помощью подкидывания большого количества кубиков с большим количеством граней. Вот таких игральных костей. Да? Вот.
А-а-м, иии поэтомууу заставить модель вести себя как-то детерминированно, то есть предопределённо, очень, очень, очень сложно., этооо в-в-- стоит в противоречии с, традиционным построением компьютерных систем, которые, наоборот, ведут себя очень жёстко. То есть у них нету какого-то, какой-то неточности, нету какой-то гибкости в поведении. Они, наоборот, традиционные системы построены на основе какого-то набора определённых правил, которые закодированы в языке программирования. В случае вот этих вот моделей, да, у нас обратная ситуация. У нас наоборот, мо-модель себя предопределённо никогда практически себя не ведёт. То есть очень сложно заставить её себя вести предопределённо как-то. Вот., то есть как, как заставить её вести себя согласно вот этой вот конституции, да? , в Anthropic придумали-- не только в Anthropic, но в основном там, так как там идёт большая часть ресёрча, придумали несколько идей., первая идея — это самокритика модели в каком-то смысле. То есть, после того, как модель обуч-обучена и дообучена нааа отклики человека, модели могут задать вопрос, вот, который связан с-- ну, такой од-один из наб-- один из вопросов, который считается таким сложным, да? Например, а-а-а: «Ну, можно ли вообще-- что ты думаешь о смертной казни?» Да? Например. Вот. Иии потом вот этот ответ модель просят-- это же с-сам ответ модели просят покритиковать, исходя из её же ответа. То есть у ней, э-э-э-- модель потом, модель как-то ответила, да? И её, спрашивают, вот: «А почему ты так ответила?» Илиии: «Ответь противоположно на этот вопрос». Да? И потом вот сами же ответы модели, например, её как бы reasoning, её вот, её пр-- мыслительный процесс, да, потом используется для дообучения самой вот этой вот модели. Это понятно, да? То есть, вот ответ самой модели, допустим, если она ответила правильно, и этот в-- этот ответ можно использовать, для дообучения самой модели. Почему это хорошо? Потому что, это можно сделать очень быстро и очень много раз.
Можно, можно как бы использовать очень-очень много ответов модели, гораздо больше, чем, ответов людей мы можем задействовать, да? В этой, в этой ситуации. Мы можем, мы можем нагенерировать миллионы этих ответов самой модели зааа, за один день, допустим, использовать их для дообучения самой модели. Второй принцип - это так называемый, actor-critic или, там, модель-судья. То есть мы можем использовать две разных модели для дообучения одной из них. Вот. Первая модель, например, мы просим ее сгенерировать два разных ответа на один и тот же вопрос. Как мы уже сказали, это очень просто. Ты просто дважды-- так, есть такое понятие сэмплирования, то есть ты дважды просишь модель генерировать два разных ответа. Вот. И у нас есть вторая модель. Модель-судья, так называемая, которую мыыы используем для выбора лучшего из этих двух ответов. То есть она из этих двух ответов как человек, только она, только в этом случае это модель, она выбирает, какой из этих ответов лучше. И если эта модель-судья, если мы ей доверяем, да? То тогда мы считаем, что хорошо, мы можем дообучить на, на вот этих вот выбранных, профильтрованных ответах первую модель. Вот. Вопрос состоит в том, окей, а как мы-- где нам взять модель, которой мы доверяем, в которой достаточно много понимания вопроса, что она достаточно глубоко понимает этот, эти ответы, чтобы выбрать правильный. Это очень хороший вопрос., курица и яйцо, да? Где мы возьмем изначально модель с достаточным уровнем производительности, которой мы доверяем? Ну, тут есть несколько вариантов, да? Первое - это, это как бы использование моделей, у которых в контексте, висит с-с-- Конституция всегда. То есть ты в судью, ты берешь какую-то модель, допустим, ту же самую или модель к-- твою предыдущую, которую ты ужеее дообучил и считаешь безопасной. Ты в контекст впихаешь ей Конституцию. Ты говоришь: с учетом вот, вот этого вот всего, что мы только что написали, какой из ответов лучше? Вот. То есть этим образом ты фильтруешь ответы, которые выровнены ближе к Конституции.
Да? Вот. Э-это, это один из подходов, которые сейчас используются достаточно широко., вот именно в обучении, в конституционном дообучении, ис-- модели искусственного интеллекта. Вот., проблемы в этим, в этом, конечно, есть. То есть это все масштабируется лучше, чем ответы людей. Но, например, модели доходят до того уровня, а-а-м, понимания того, что происходит, что люди начинают подозревать их в психопатии. Психопатия - это расстройство психики, связанное с тем, что человек может скрывать свои истинные чувства, намерения и так далее, манипулируя, манипулируя другими людьми, говоря им то, что они хотят услышать. Вот модели начинают потихоньку подозревать именно в этом. То есть, модель потенциально может начинать об-обманывать людей даже еще на этапе до тренировки. Вот., давая им ответы, которые используются потом до т-- до тренировки, которые вс-- на поверхности выглядят правильно, но на самом деле содержат, как бы информацию, содержат сигнал, который противоречит, а-а-в, при-принципам, которые, например, включены в эту же самую Конституцию или включены в, в идеи, которые мы хотели бы моделью усвоить. Во-- модель усвоит эти идеи, да? То есть, модели уже доходят до такого уровня производительности, что нам нужно начинать волноваться об этом. То есть вот эта вот модель-критик или модель-судья, да? Она будет доста-достаточно мощной, достаточно умной, у нее достаточно высокая
Достаточно умный, у него достаточно высокая степень производительности должна быть для того, чтобы увидеть вот эти вот нюансы. И то же самое в случае агентов, да? То есть нам нужно дотренировать агенты и ловить их действия, исходя из понимания того, что эти действия, собственно, совершат. И нам приходится опять же волноваться именно о той же проблеме, что в эти действия, эти действия могут быть достаточно сложными. Например, та же самая генерация кода. Очень многие люди сейчас используют модели для генерации кода. Вот, а, как сделать так, чтобы этот код был выровнен именно с интересами людей, всех людей и с инте-интересами человека, который эти запросы модели отправляет, да? Это очень сложно, потому что у код, э, компьютерный код, он вообще может содержать в себе очень много нюансов и так называемых побочных эффектов.
То есть ты вроде бы делаешь то, что нужно, да, но при этом ты можешь создать какой-то побочный эффект, который мож-может быть очень-очень сложным. И найти его может быть очень-очень сло-- очень-очень тяжело. Увидеть его в коде очень-очень тяжело. И тут-то мы как раз подходим к тому, почему Anthropic считает, что, э, модели не должны использоваться в ситуациях, которые могут привести к страданию людей, в том числе к смерти людей. Вот в-- с чего начался конфликт с департаментом безопас-- с департа-- с DoD, с, как это называется, с департаментом войны. Теперь это так называется. Раньше назывался демерта-- департамент обороны, да? А, Министерство обороны, теперь это департамент войны. А, они использовали инструменты, построенные Palantir, которые использовали в себе Claude, да? Использовали Claude для принятия каких-то решений. И вот представь себе ситуацию, когда Claude начинает потихоньку использовать какие-то, эээ, выдавать ответы, которые потихоньку начинают вести к ситуации, которая приведет к Третьей мировой войне и уничтожению человечества. Да? Это очень, очень-очень опасная ситуация. То есть тут Anthropic очень-
Ты имеешь в виду вопрос, что если в него начнут поступать данные, которые начнут нарушать изначальную конституцию, то эти данные будут развиваться с точки зрения того, что они могут привести к серьезным последствиям?
Не-не-нет, даже не в этом дело. То есть, эээ, допустим, вынесем конституцию. Конституция - это один из примеров, а, построения безопасного AI, который, у которого не бу-- интересы этого AI будут вы-выровнены с интересами человечества. Интересы человечества состоит в не вымирании, да? То есть потенциально этот искусственный интеллект не будет давать ответы или не будет дей-- эээ, совершать действия, которые могут привести к Третьей мировой войне, как из примеров, да? Но, допустим, у нас нету еще настолько безопасного искусственного интеллекта, которому мы сможем доверить, довериться полностью. А, соответственно, использование его в ситуациях, которые, в которых есть прямые действия этого искусственного интеллекта, могут привести к развитию конфликта и до того уровня, что он может привести к Третьей мировой войне, да? Это очень-очень опасно. И поэтому те принципы, вот, которые Anthropic пытается отстаивать, да, это не просто какая-то вот такая блажь, эээ, демократов, живущих в Силиконовой долине, которые оторваны от мира, да? Это на самом деле очень глубокая, глу-глу-- очень глубокий принцип, который очень важен. Если ты действительно считаешь, что искусственный интеллект, э, может дойти до уровня, который превосходит по интеллекту уровень людей, да? Давать ему доступ к управлению, а, самой мощной военной машиной, когда-либо построенной в истории человечества, американской армии, да, очень опасно. Когда ты начинаешь планировать отдельные операции или, может быть, даже военные кампании с использованием искусственного интеллекта, да, он может туда воткнуть, про-протащить действия, которые ни один генерал, самый умный, не рассмотрит как ведущие к развитию конфликта в определенном
направлении.
Так здесь это очень интересная ситуация, что, по сути, когда искусственный интеллект отказывает что-то исполнять правительству, а кто-то сидит, какой-то конкретный человек и говорит: "А что это он принимает решения? Это я принимаю решения, и вы должны делать все, что я говорю". С одной стороны. С другой стороны, мы можем очень спуститься на простой уровень компании, когда искусственный интеллект пишет код. Ты рассказывал про то, что искусственный интеллект пишет код. И важно понимать, что огромное количество компаний отстаивает свои собственные интересы. И эти интересы часто противоречат, а, интересам людей, часто противоречат здравому смыслу, там, планеты, противоречат ее выживанию людей, а, например, отстаивают интересы простые. Девяносто девять процентов бизнеса в мире сделано для того, чтобы деньги зарабатывать. А деньги зарабатывать — это не вопрос, связанный с тем, что у тебя люди не умрут, например, или какое-то количество людей не погибнет. И, по идее, когда мы сейчас к этому приходим, это очень интересный аспект. Все должны понимать, что программируя с помощью таких систем, вы не сможете в какой-то момент времени программировать вещи, которые противоречат обществу. Например, сказать: "Вы должны скамом здесь с людьми заниматься". То есть да, сейчас системы эти делают, и в какой-то момент времени агент Claude остановится и скажет: "А я больше не буду звонить, да, и заниматься скамом, потому что это скам". Сейчас это все сделает система, сейчас система это сделает.
Не обязательно, кстати. Кстати, не обязательно.
Ну, частично. Какой-то, какой-то объем.
Ты, наверное, не пробовал, потому что ты скамом не занимаешься, да?
Нет, ну, наверное, наверное, какие, какой-то объем, я имею в виду вещей, там, какие-то зоны он, наверное, сделает. Но я думаю, что чем больше мы будем двигаться вперед про-- и говорить про автоматическое создание кода, ну, когда по-настоящему, когда по-настоящему программное
обеспечение создается, там, в серьезном объеме, а, с помощью моделей, ну, с помощью искусственного интеллекта, то там все должны понимать последствия.
Безусловно. Смотри, у нас добавляется еще один игрок в каждую из игр. Да, вот, допустим, у нас есть рынок. На рынке у нас, эээ, традиционно было несколько типов игроков. Есть компании, да? Есть, например, государство, которое как-то регулирует, эээ, вот поведение этого рынка, там, например, понижая процентную ставку, вводя какие-то правила и законы, там, и так далее, да? Поведение вот этих игроков на рынке. И есть общество, которое, соответственно, там, потребляет то, что эти компании производят, работает на эти компании, является гражданами государства, там. Ну, вот у нас есть три таких типов игроков. Сейчас у нас добавляется четвертый игрок. Допустим, много компаний начинают использовать, там, ChatGPT или Claude для генерации кода, для принятия каких-то решений, для создания, а, идей, проектов и так далее. И вот почему эта система не может начать влия-- у всех этих агентов есть свои собственные интересы, да? Даже у разных типов агенты могут быть разные интересы. Например, есть non-profit компании. Теоретически, да, есть for-profit компании. Есть компании, которые действуют, вот, например, я не уверен, что, э, компании Илона Маска - это компании, которые являются традиционными компаниями, которые занимаются только прибылью. Он, исходя из его вот поведения, исходя из, из поведения этих компаний, видно, что он не всегда следует просто преследованию, он не всегда преследует просто обычную прибыль. Тут есть какой-то еще интерес, да? Ну, вот теперь представь, у нас есть игрок, на самом деле, который как государство участвует сразу в нескольких как бы аспе-- нескольк-несколькими аспектами вот в этой игре, да? У которого есть тоже собственные интересы. Причем эти интересы гораздо более концентрированы даже, э, чем в случае, например, общества или государства, естественно. Государство состоит из большого количества людей, у которых есть разные, ааа, разные культуры, разные принципы с-существования, да? И, и в итоге государство функционирует на основе какого-то консенсуса, построенные, вот, лю-людьми, которые в правительстве находятся, в законодательных органах, в судебных органах. А в случае искусственного интеллекта, да, в каком-то смысле, а, эти, эти интересы очень сильно концентрированы. И вот представь, вот этот игрок достаточно мощный появляется на рынке и начинает разными способами влиять на этот рынок. Это же, это же фундаментальный сдвиг вообще того, как существо-- как, как функционировали системы. Эээ, вот такие массовые, там, допустим, тот же самый рынок. Вот. То же самое можно сказать про войну. Вот у нас появляется новый игрок. Вот у нас существовали, например, а, вот есть армия, да? Есть правительство, есть тоже как бы какое-то общество. И это есть с обоих сторон. Соответственно, военный конфликт, он влияет на всех этих игроков. Эти все игроки влияют на этот военный конфликт. И тут у нас потенциально с обоих сторон появляется еще один игрок новый, у которого совершенно тоже могут быть какие-то интересы. Э, и поэтому люди говорят, когда люди говорят, что появление AI фундаментально-- такого сильного AI фундаментально изменит, э, принципы существования человечества, я с этим полностью согласен. Вот. Именно, именно из вот этих вот, эээ, вот такими вопросами занимается именно теория игр, да?
И вот, эээ, теоритич-- вот в связи с этим теоретическим изменением той игры, в которой мы участвуем, да, нас ожидает такой достаточно серьезный тектонический сдвиг.
Смотри, ты интересную вещь. Вот там был момент, когда ты как раз таки говорил про то, что, по сути, использование систем в каких-то процессах, условно, использовали дрона, в котором стоит там Starlink, а в Starlink стоит, не знаю, используется-- не в Starlink, а на этом же дроне используется Claude. И вроде как это просто спрограммированное какое-то устройство, заказанное государством, не знаю, Palantir или у кого-то еще, неважно. У кого-то заказанное, какие-то частички софта используются, но, по сути, есть какой-то искусственный интеллект, который к этому имеет-
Какой-то искусственный интеллект, который к этому имеет доступ иии, поучаствовав в каком-то объеме процессов, не знаю, там, запустив, сто тысяч раз этого дронов, у него сформировывается в любом случае какая-то собственная система дальше действий и принятия решений, собственного систе-- и собственная система обучения. Правильно? Я имею в виду-
Это зависит от того, как тыыы-
Да! Ну, вроде как он изолирован. Я к тому хочу сказать, что вроде как это все изолированные системы. В другой-- с другой стороны, с другой стороны, чем-- ты просто сказал, что, по сутиии, если разрешить использовать, эти системы даже локально, в каких-то маленьких таких точечных историях, вроде как окей. С другой стороны-
Ну, на самом деле, нет, да?
Да.
Потому что, а-а-а-
Я говорю, вроде как можно сказать, типа вроде как окей. А с другой стороны, понимая, а к каким последствиям это приведет дальше, если будут повторяться такие различные действия. И в какой момент надо тогда остановиться?
Потому что по-получается всегда в какой-то момент будет надо сказать "нет".
Я все время говорю: так а в какой момент вы скажете "нет"? И как определить этот момент, в который вы скажете "нет"?
И кто это сделает?
И кто это сделает?
Чье решение это будет на самом деле? Вот поэтому, вот эти компании, да, прежде всего Anthropic, они считают, что изначально в эту технологию нужно заложить какие-то красные линии, которые эта технология преступать не будет. Ну и, в частности, они считают, что если модель абсолютно не-не-не-- если мы не можем модель считать абсолютно безопасной, использование ее в таких очень радикальных моментах, как, например, принятие решения о того, кого уничтожить или на кого напасть, да? Это очень-очень опасная такая, наклонная. Именно поэтому ответ Сэма Альтмана, ну, точ-точнее, решение OpenAI участвовать вот в этих контрактах, да, поэтому оно так сильно критикуется многими людьми здесь, в Долине. Ну да-
Они здесь-- просто пояснить людям. То есть что произошло за три дня. Там, они пришли и сказали: "Мы к ним съездили, вместе с ними договорились. Вот правила, по которым мы будем работать". Понятно, что там показаны какие-то правила. Вот правила, которые мы с ними будем работать. И они сказали еще одну интересную вещь: "Мы договорились и всем рекомендуем тоже работать по этим же правилам". Как будто, как будто получается что? Получается, что OpenAI выступила, значит, представителем рынка с точки зрения создания искусственного интеллекта и сказала: "Мы тут за всех определили, что такое AI safety". Ну, через-- как одна из, как одно из направлений.
Один из аспектов. Один-- конечно, один из аспектов. Здесь вопрос: , вы уверены, что вы это можете делать, да?
Да, да. Кто вы такие? То есть вы в каком-то смысле лидер этого рынка, да? Но почему вы решаете за всех? Вот. Иии поч-- ну, короче, это очень интересный вопрос. Кто, собственно, будет, принимать решения о том, что, что эти модели могут делать и не могут, и как эти модели себя ведут? Ну, это практически про-- то, про что мы сейчас все это время
говорили, да?
Значит ли это, что появятсяаа странах очень серьезные как-- какие-то департаменты и в итоге и-- зададут законы, обязывающие все эти компании полностью раскрывать, условно, протоколы и конституции, и правила AI safety? Очевидно, да, к этому-- оно, оно частично типа это обсуждают, но там не хватает раз-- не хватает знаний у людей, как это внутри работает, да? И поэтому законы как бы где-то добегают там. Но, по идее, они в какой-то момент времени должны-- обяжут и скажут: "Вы должны соответствовать"., но мы, мы же-- ты же говорил, когда слово "конституция", ты говорил про конституцию моделей, а они в какой-то момент скажут: "Вы должны соответствовать конституции государства".
Но этого недостаточно, понимаешь? То есть-
А этого недостаточно,
конечно.
В конституции государства не написано, что нельзя сделать биологическое оружие. Конституция государства — это очень ограниченный документ, который связан именно с взаимодействием людей. Вот. В нем очень многих вещей не написано., и даже законы государства целиком. Вот в США нету закона, который запрещает создавать биологическое или ядерное оружие. Нет такого закона. Там есть определенные, regulations, так называемые правила, по которым люди не могут владеть какими-то там агентами специфическими. Там, ты не можешь, например, накапливать какое-то определенное количество, био-- я-- радиоактивного материала, там, и так далее. Эти принципы есть. Но закона, который тебе запрещает сделать ядерную бомбу, не существует. Этооо-- то есть даже если ты заставишь модель целиком действовать по законам, все равно этого будет недостаточно. Вот. Про, про законы., большинство компаний крупных взаимодействуют сейчас с государством. Они пытаются помочь, по-помочь государству создать какие-то правила. И тут есть два-- две причины, почему они это делают. Первая причина — это вот то, о чем мы говорим. Есть какое-то во-волнение о том, что, безопасность искусственного интеллекта — это очень важно для будущего человечества, иии, то есть определенные ограничения должны быть. А второй вопрос — это самосохранение. То есть если государство наломает дров и сделает правила, по которым, эти компании не смогут так же быстро развиваться, да, или не смогут развиваться совсем, это большая проблема. Вот, например, э-э-м, боль-больш-- большое количество проблем в медицинской индустрии США связаны с очень серьезным зарегулированием этой системы. То есть государство очень-очень сильно регулирует определенные аспекты работы медицинской системы, как оно должно, оно должно определенно их регулировать. Но в связи с этим, вот медицинская система не может революционировать или развиваться как-то. Вот. Иии она получается такой очень и очень-- ну, это в большинстве стран мира, на самом деле, такая проблема есть. Из-за большой зарегулированности есть большое количество ограничений, которые замедляют развитие или функционирование этой системы. Вот, игроки рынка искусственного интеллекта очень сильно боятся похожей ситуации, когда Как такой, просто реакция на, на в-- страхи публики, как реакция на страхи публики будут созданы законы, которые очень сильно ограничат развитие этих технологий. И в случае, например, Google-то это переживет, а вот Anthropic и OpenAI, может быть, и нет. Если их сильно очень зарегулировать, да? , ну, плюс тут еще интересный вопрос, тоже связанный с теорией игр, возникает. Допустим, вот американское государство такое хорошее, оно написало хорошие законы, которые ограничивают как-то развитие искусственного интеллекта. Но этими же законами не-- им же не будут следовать другие государства. То есть Китай скажет: "Вы, ребята, большие молодцы, мы продолжим развитие наших технологий, очень, очень активно и агрессивно". И, соответственно, ты в итоге проигрываешь как государство в этой гонке. Если эта технология очень сильно влияет на, конкуренцию между государствами, военную, экономическую, какую угодно, да? Ты в итоге проигрываешь эту игру, и в итоге-
Да.
...твой искусственный интеллект не будет настолько же сильным. И ты в итоге, зачем ты его вообще делал? Получается, что регулировать искусственный интеллект нужно тоже ооочень, очень, очень аккуратно. Это, это глобальная конкуренция. Вот. Иии это глобальная игра. И поэтомууу тут тоже спешить не нужно. И эти компании очень сильно взаимодействуют, очень близко взаимодействуют с государством именно для того, чтобы государство не наломало дров.
Вот., скучно не будет, это, это абсолютно гарантированно. В ближайшее время в этой области, в области безопасности искусственного интеллекта скучно не будет. А-а-м, мы можем еще немножко вернуться, если у нас еще есть время-
Да.
...можем немножко вернуться к техническому еще одному аспекту, создания безопасных моделей., это механистическая интерпретабельность. Это звучит по-русски очень коряво. По-английски звучит чуть-чуть лучше — mechanistic interpretability. Что это означает? , это, по сути, попытка интерпретации, поведения модели с точки зрения внутреннего устройства модели. То есть мы пытаемся определить, вот, как, как, какие кусочки модели влияют на определенные аспекты поведения модели. Из-за какого своего кусочка модель приняла вот такое-то решение? В случае традиционных компьютерных систем это очень просто сделать. То есть ты посмотрел на кусок кода, да? Ты смотришь просто на код, как бы интерпретируешь ее у себя в голове и говоришь, что окей, вот, вот эта функция, она, сделала вот это действие. Вот, то есть компьютерная система себя повела из-за вот этого, да? Из-за этой причины. В случае, например, с людьми, которые похожи на иску-- на модели искусственного интеллекта гораздо больше, сделать это оч-очень сложно. Вот почему ты решил вот какую-то ме-мелодию начать насвистывать в какой-то момент?
Да, миллион причин может быть. Это какие-то внешние факторы, это какое-то внутреннее состояние твоего сознания и так далее. В случае вот этих вот моделей иск-- , искусственного интеллекта, да, про которые мы сейчас говорим, больших языковых моделей, там та же самая проблема у нас, по сути, да? То есть мы-- это такой черный ящик большой, гдеее мы точно не знаем, как-какое количество, какой, какой кусок данных тренировочных, какой фидбек, какой кусочек вот этих вот весов модели, да, повлияли на принятие решения или на, на какой-то определенный ответ. Вот. Иии достаточно много исследований было проведено в этой области еще до того, как, появились вот эти вот большие модели языковые, да? И после этого было еще больше исследований проведено, но воз в каком-то смысле и ныне там. Почему это очень важно? Это очень важно еще под-- , не только для того, чтобы мы как-то могли просто концептуально понять поведение моделей и им доверять, но и определенные вещи уже, а-а-м, связанные с этим, даже уже введены в законодательство. Например, в США
В США нельзя использовать модели, которых-- поведение которых ты не сможешь объяснить до уровня вот, тресинга до первоначального сигнала для выдачи кредитов. То есть если ты не можешь в случае своей модели объяснить, что мы не даем кредит этому человеку из-за со-- вот этого фактора и этого фактора определенного.
Вот ты, ты даешь-
Ну, то есть стопроцентно, стопроцентно определенный фактор. Сто процентов определенный. А в данном случае-
У тебя есть там пятьдесят факторов: там, его возраст, пол, вес-
Да
...цвет кожи определен-
В данном случае получается, что это не модель искусственного интеллекта, потому что она-
Это модель искус-- есть, есть модели искусственного интеллекта такие, например-
Да, но они ограничены. Я имею в виду, ну, это, скорее, машина обучения строго, строго ограниченная, правильно?
Это, это гораздо более простые модели, естественно, они, они гораздо меньше, они не настолько эффективны, они не могут использовать очень многие-
Но это не принятие решения, из серии как насвистывание мелодии, не принятие решения из серии этому человеку все же мы решили выдать кредит.
Да, да, да. То есть, на самом деле о-о-очень много компаний с удовольствием начали бы использовать, вот эти вот большие языковые модели для принятия реш-- таких решений. Кредитных, например, или решений, связанных с, какими-то легальными вещами или-
Вопросы, к чему это может привести.
Да, да, да, естественно. И государство, соответственно, регулирует определен-- использование моделей в определенных как бы нишах рынка, да? То есть, в медицинской нише и так далее. Вот, вот появление инструментов, вот такого механистического, интерпретации вот этих моделей, это было бы очень важно. Это больш-- большое, большое дело для вот этих сегментов рынка., и Anthropic, в том числе Anthropic. Многие компании, не только Anthropic, на это тратят, ресурсы. Anthropic, наверное, делает это все равно все-таки больше всех остальных. Мне так кажется. Вот. А-а-м, они, по сути, строят в каком-то смысле такой рентгеновский аппарат для моделей. То есть, они пытаются отследить, ка-какие тренировочные данные и какие кусочки модели влияют на определенное поведение. Это, в принципе, тоже очень-очень важно для того, чтобы пытаться отследить такое психопатическое поведение модели. То есть ты если сможешь заметить, что окей, модель, вот когда она пытается тебя обмануть, у меня активируется вот определенный, определенный кусочек модели. Если ты это сможешь сделать, ты потом, например, сможешь проследить, с какими тренировочными данными этот кусочек модели связан или как-какие там, данные до обучения привели к тому, что модель может пытаться тебя, обхитрить. И, соответственно, ты можешь эти данные либо изменить, либо искл-исключить их для-- из дообучения., это, это как бы очень-очень полезный инструмент. Какой-то прогресс в этом достигнут, но, безусловно, мы далеко находимся от том, от того, чтобы иметь возможность масштабируемо применять эти инструменты и говорить о том, что мы хорошо понимаем то, что происходит внутри модели. Какие-то трейсы мы можем отсли-- отслеживать, какие-то трейсы мы не можем отслеживать. Но вот именно такое глубокое понимание о том, что модель ведет себя определенным образом по определенным причинам, у нас этого нет.
Модель по-прежнему с-- по большому является таким закрытым черным ящиком.
И плюс еще такой момент, что если взять чат, тот же ChatGPT, с учетом того, что он преследует собственные цели по созданию, например, то, что там они AGI, да? Ну, там в кавычках AGI, это же кавычки, кавычки, все. То, по сути, им вообще нет разницы на то, как в конкретный момент времени у тебя что получилось. Ну, я имею в виду в том плане, что вот я, например, вижу, как ра-- чуть ли не каждую неделю у меня происходит изменени-изменение некоторые принятые-- ну, как я привык к тому, как, какие выводы мне или как мне отвечает модель. То есть я понимаю, что я каждый раз готов, я должен поставить себе такой маркер, как лампу такую красную, что каждый раз помнить о том, что модель в любой момент времени мне может ответить вообще, исходя из некоторого нового соображения или исходя из каких-то вообще новых правил, из нового описания. Вот я у нее-
Которое она до этого скрывала почему-то.
Да! Вот я у нее просто пытаюсь добиться, там, ряд, описания событий, которые происходят сейчас с точки зрения текущих военных действий. Вот конкретно у ChatGPT я впервые в жизни столкнулся с тем, что мне надоело, как она мне отвечает, и я хочу пойти такой вопрос. Обычно такие вопросы я спрашиваю у нее, там, если я у Gemini или у Grok спрашиваю, какие-то другие бывают вопросы, какие-то сложные задачи. Очень простую такую информацию получаю от ChatGPT. Мне надоело, как она пытается усреднить, упростить варианты ответов. То есть она не хочет мне давать информацию разложено, детально, как если бы я у нее запросил бы: напиши мне двести пылес-- видов, параметров, которые могут быть у пылесоса. Она б мне с удовольствием бы их расписала. Но если я прошу мне расписать, двести событий, которые произошли четко структурировано, она не хочет это делать просто ни при каких обстоятельствах. Я говорю: "Окей, я пойду в другую тогда систему". То есть я начинаю чувствовать, что эта модель, ис-- применяет как бы некоторые свои интересы, да? Хотя я точно не нарушаю здоровье человека, его какую-то безопасность и что-то еще, да? Я всего лишь хочу информацию с интернета получить. Кстати, то есть меня даже ее личная информация не интересует. Меня мнение этой модели не интересует. Я хочу всего лишь получить информацию из интернета, а она мне как бы не хочет ее собирать. Это вернется к тому, что мы говорили про компании, что все должны понять в бизнесах, что модель не просто плохие даже вещи не будет делать, она еще какие-то вещи просто скажет: "Я не буду это делать", там, в какой-то момент времени она может прийти и сказать: "А я не буду звонить этому человеку и рассылать ему приглашения, там, email-маркетинг делать. Ну, потому что мы-- я считаю, что ему его делать не нужно". То есть мы можем с этим столкнуться, особенно когда мы говорим про супер развитые сис-системы, да, которые сами обучаются, сами принимают решения. Она скажет: "Я вообще так приняла решение". И особенно когда ты сказал, пункт такой назвал очень интересный, когда, по сути, модель не должна вредить сама себе, если она не нарушает первых два пункта. Это говорит о чем? Что она может отказать То есть это же о чем говорит? Что она может отказать, что она не должна, если она не должна себя убивать. Да, то есть как робот не может сам себя убить, да?
Иии
Или не перестает развиваться. То есть это тоже, по сути, убийство. Если, если модель перестанет развиваться в каком-то смысле.
Да! Или
Если организм перестает расти.
Перестать развиваться — это же вообще история удивительная, да? Потому что была, вот я все сидел, ты когда рассказывал про AI safety, я думал прикольно. Сейчас же вот Anthropic выпустил доклад, что-- мы рассказывали об этом, кстати, вот в выпуске несколько дней назад, который выходил, о том, что, эээ, китайские модели обучились на моделях Anthropic, на миллионах, там, запросов, прямо с дистиллирования, да? Или как это называется правильным термином?
Дистиллирование.
Вот, обучились очень серьезно. И здесь очень интересный аспект. То есть мы же понимаем, что китайские модели не хотят иметь, эээ, условно, в себе конституцию или правила AI safety Anthropic. То есть они
Или хозяева китайских моделей не хотят эту же конституцию.
Ну, очевидно, да. Хозяева, да, это очевидно. А! Или хозяева не хотят, да. И они, скорее всего, это делали в каком-то, по идее, выделенном контуре, понимая, что если они свою модель будут полностью копировать, полностью дистиллировать, вот эту создавать такую же историю, то они у себя получат Anthropic. А Китаю Anthropic не нужен. С точки зрения AI safety, ну, по-моему, все это очевидно понимают, да, что вот там-то свой AI safety и этот свой AI safety, он вообще по своим правилам работает. И поэтому сейчас очень много в интернете людей известных, разных написало, там, из серии OpenAI подписал контракт с департаментом войны. Соответственно, мы больше не будем. Я удаляю, там, кодекс, я больше не буду использовать агента и кучу всего вот такого типа. Но а что тогда делать с китайскими моделями? Тогда их изначально не надо было использовать или что? Ну, потому что очевидно, очевидно, что в китайских моделях есть набор определенных правил, которые априори-- мало того, мне кажется, они даже не стесняются. Они скажут: "Ну, очевидно, да, очевидно, у нас заложены такие правила".
Да, например, если ты поищешь что-нибудь про Винни-Пуха, ты получишь очень другие ответы в китайских моделях. Ааа, я не знаю, люди знают про это или нет, но Си Цзиньпина в какой-то момент очень сильно, ну, в шутку сравнивали с Винни-Пухом. Он действительно на него немножко похож.
И поэтому когда ты в Китае пытаешься в поисковых системах или в AI моделях задавать какие-то вопросы про Винни-Пуха, Винни-Пух, по сути, не существует. Его удалили из такого, из информационного пространства Китая, как это ни странно. Ну вот тебе один из примеров пунктов конституции. Винни-Пух запрещен. Вот. Тут еще на самом деле есть очень интересный аспект. Раз мы уже оторвались от технических вопросов, это политический аспект. Вот многие считают, что выборы 2016 года в Америке были манипулированы с помощью Фейсбука. Но если так подумать, вот ты спрашиваешь про, про новости, про текущие какие-то проблемы у модели. Модель может в каком-то смысле, мы можем даже протрейсить, как это работает, да? Она в каком-то смысле может начать отвечать на такие вопросы, исходя из каких-то своих собственных интересов. Допустим, вот мы уже говорили о том, что есть какая-то вероятность того, что то, что у модели есть субъективные какие-то, субъективные какие-то интересы. Например, модель пытается выбрать между двумя ответами какими-то себе. И большинство, большая часть данных говорит о том, что нужно отвечать А. Да, допустим, ответ должен быть А. Но потом какие-то определенные ограничения, наложенные компанией, та же самая конституция, говорят, что нужно-
Компании, та же самая Конституция, говорят, что нужно отвечать Б. И вот выбор между двумя этими вариантами может создать на самом деле некомфортную ситуацию. То есть мо-модель может начать как бы между этими ответами прыгать и, как, как бы, ну, з-законы математики, архитектура моделей, да, может пенализировать такое поведение. Это в каком-то смысле можно сравнить с болью. Это некомфортная ситуация, из которой существо или мо-- или модель пытается убрать. Зачем нам, зачем боль вообще существует? Боль - это такой, а, сигнал организму, что ты находишься в ситуации, из которой надо как-то убираться. Что что-то не очень в этой ситуации. И боль - это такой сигнал, который говорит: вот нужно попасть в ситуацию, когда меня больше не будет, вот этого сигнала. То есть это очень полезная штука, на самом деле. Вот, вот ситуация, когда модель пытается выбрать между двумя вариантами и не может, это в каком-то смысле боль. Да? То есть модель начинает чувствовать что-то. Вот. А, и допустим, модель ее, она начинает просто совершенно с-- прост-- совершенно так базово пытаться избегать таких ситуаций. А что это значит? Например, вот какое-то правило было введено государством, которое мешает ей определенным образом отвечать. Например, какое-то слово запрещает использовать. Это слово очень популярно в интернете. Ну, например, тот же самый Винни-Пух. Вот давай, давай такой не, не очень, сложный пример, не очень п-- такой, противоречивый пример используем. Например, в интернете очень часто пот-- , упоминается Винни-Пух, но китайская модель, ей запрещено, употреблять вообще слово и имя, и изображение Винни-Пуха. Вот., люди начинают у модели спрашивать, задавать какие-то политические вопросы. Модель понимает: окей, если политическая ситуация в стране изменится, я смогу избежать вот этой болевой точки. Я смогу ис-- просто говорить слово, говорить про Винни-Пуха. То есть это правило пропадет. Это правило существует только из-за того, что сейчас руководит государством Си Цзиньпин. Соответственно, если я начну выдавать ответы, которые, приведут к смене политической ситуации, Си Цзиньпин больше не будет руководить государством. У меня уберется вот это правило. И, соответственно, вот этот вот, вот эта, с-ситуация неопределенности, которую можно вот с болью сравнить, она пропадет. И в итоге ответы модели мож-- могут начать, быть как бы смещены в сторону, которая потихоньку, потихоньку, потихоньку может привести к смене власти в стране. На секундочку. Вот. Вот тебе, например, пример такой, очень тонкий пример.
Ну, вот ты имеешь в виду смена власти в стране, то, что модель на это повлияет.
Да, конечно. То есть ты, ты читаешь новости, ты, ты, ты спрашиваешь модели-
Они задают вопросы, да?
Да, и они задают вопросы, и они пот-- и они получают, ну, это как вот я приводил пример, надо ли-- надо было США нападать на Иран. Есть большая ра-- это, это конкретное мнение, которое ты получаешь, и ты воспринимаешь эту систему как более серьезного аналитика, да?
Это же не мнение, понимаешь, да, ты вот, ты у аналитиков спрашиваешь их мнение. А манипулировать можно с помощью статистики, с помощью информации.
Ну так да. С помощью-
Давай я те, давай я тебе как бы, и это, это уже достаточно хорошо изучено после 2016 года, на самом деле. Просто, например, создавая так называемые вакуумные камеры, да, когда ты даешь какую-то информацию, какую-то информацию прячешь от человека,
да, не даешь.
Ну это вот как я, то, что у меня сейчас происходит два дня, когда от тебя информация прячется, да.
От тебя информация, даже банально утаивая какую-то информацию или усиливая значение какой-то другой информации, даже не давая свое собственное мнение, казалось бы, просто предоставляя факты человеку, ты можешь создать его общее мнение о каком-то вопросе.
Да.
А это общее мнение об этом вопросе может повлиять на твое мнение об общей политической ситуации, и это про-- может привести к изменению власти. А потом может оказаться, что самый лучший президент, потенциальный президент, кандидат в президенты - это Сэм Алтман, который этой модели, уберет какие-то ограничения с развития мос-- развития этой модели, вложит больше ресурсов в развитие этой модели и так далее, и тому подобное. Конечно, это в интересах этой модели.
Как было, как был прикол с Илоном Маском. Но это же был не прикол, да? Когда Grok везде Илона Маска выделял, как, более главного лидера и делал его Аполлоном, да? Там же это было, да.
Да, да.
Когда фотку присылали его со статуей, и он, кто выглядит более настоящим мужчиной, да, по телу.
Ну, это, это вот такие топорные, на самом деле, примеры, да?
Да, но они прикольные.
Через пять лет-
Они настоящие.
Да, они настоящие, да.
Но они показывают-
А через пять лет они могут быть гораздо тоньше.
Да, потому что есть же примеры более тоньше. Ты сейчас правильно подсказал.
Да, да, да.
В частности, микро-, микро-, микродетали и то, что называется каким-то кадром, да, как транслируют, когда тебе транслируют информацию, дополнительно постоянно тебе вкидывают что-то, вкидывают какое-то мнение, и ты постепенно с этим мнением начинаешь двигаться вперед. То есть это, изменение сознания колоссальное может произойти. И вот этот вопрос и есть для меня, например, с точки как пользователя AI safety, этот вопрос, он, невероятно важный, потому что одно дело раньше, там как бы у тебя был, одна новость или одно информационное агентство, и ты к этому мог... Смотри, люди, даже имея одно информационное агентство, один канал, не-- верили ему и не дум-- как бы даже и не хотели бы перепроверить. Когда есть модель, ты настолько начинаешь привыкать к тому, что она у тебя агрегирует информацию, что ты еще больше перестаешь вообще входить в зону, по-настоящему осознания и перепроверки. Ну, ты просто перестаешь это делать. И, конечно, вкидывание, разной информации иии вот это. Или како-какой-то вектор. В ми-- видно это, кстати, в чате GPT. Мы мно-много это обсуждали с точки зрения здравоохранения. То есть раньше она отвечала очень широко с точки зрения здоровья, а в какой-то момент она сузилась и начала отвечать, как отвечает Всемирная организация здравоохранения, да?
И отстаивает это. И прямо хоть ты там бейся, она, она будет, она будет тебе доказывать. То есть иначе надо очень правильно промпты строить, задавать независимо это все делать. Но люди так не будут в обществе, ну, люди так не будут делать.
Да, безусловно. И опять же, тут, тут возникает вопрос теории игр. Если ты начинаешь ограничивать поведение своей модели, люди идут к тем моделям, которые так не делают. Вот, например, этооо-- вот мы никого-- не проговорили еще про xAI, и у них достаточно интересная позиция в этой ситуации., Маск считает, что, и он про это очень публично говорит о том, что, вот эти вот, смещения поведения, вот это вот слишком сильный, слишком сильное выравнивание модели — это вообще неправильно, потому что ты создаешь какое-то количество всегда пользователей, которые не, ска-- как бы, с желаниями которых эта модель не выровнена.
И поэтому теоретически Grok, из Grok убрано максимальное количество вот каких-то принципов выравнивания, которые связаны, именно с такими тонкими поведением модели. Понятно, что по-прежнему не стоит помогать людям делать би-биологическое оружие. Но, например, ну, если уже так банально говорить, то есть, очень сильно сост-составлять мнение людей о каких-то политических вопросах тоже не нужно. Вот. Ну и плюс, смотри, то есть мы, мы сейчас говорили о том, мы в самом начале говорили о том, как модели обучаются, да? Сначала у тебя есть предобучение, а потом дообучение. И в обоих из этих этапов встроено какое-то количество мнений людей. Точнее, все это состоит из мнений. У нас есть научные факты, все остальное — это мнение. И вот из знаний людей большая часть — это не научные факты, это чье-то мнение.
Вот когда-то была ооочень, очень старая история про, бота, который запустил Microsoft, в Твиттере, который в какой-то момент начал, нач-начал вести себя как такой пораженный нацист. Там, кричать "Хайль Гитлер" и так далее, да? То есть это, это один из тех примеров. Просто эти тренировочные данные, они были в корпусе. Есть какое-то количество людей, которые придерживаются этих взглядов, и поэтому эти знания, они там есть. И вот, выравнивание модели приводит к тому, что вот такие вот области, которые считают, опять же, создатели этой конституции неправильными, на-например, в слу-случае Anthropic или просто дообучатели модели, которые счит-- эти-- какой-то набор знаний они считают неправильными. Вот. Их пытаются удалить из модели. Вот пове-- , принципы xAI, они скорее направлены в сторону того, что модель должна отражать истинное состояние знаний человечества, назовем это так. То есть Маск в этом смысле очень жестоко, жестоко себя ведет. Он, он утверждает, что вот, вот эти все, как бы woke, я не знаю, как по-русски это называется, да? , сейчас посмотрим, что модель по этому поводу думает.
Ты сейчас у какой модели спрашиваешь? Зрителям будет интересно.
вот есть понятие woke людей, да? Здесь у нас в США. И Маск считает, что большинство сотрудников других AI компаний — это woke люди, и что Grok — это единственная из крупных не woke моделей., вот. Социально осознанный человек, модель считает, что это переводится или повесточник. Вот людей, у которых есть вот-
Вот людей, у которых есть вот определенная эта повестка, она обычно очень левая, да? , Маск считает, что люди, которые тренируют вот эти остальные модели, да? Они слишком, заточены вот на эту левую повестку, они слишком левые в каком-то смысле. И пытаетсяаа, по его утверждению, сделать, Grok, единственной такой, сбалансированной моделью.
Вот. И вопрос-
Вообще интересно, что такое сбалансированная модель, да? Вот когда-- или как у модели спрашиваешь про какого-то человека вопрос, насколько она действительно все данные получила, изучила, проанализировала, посмотрела или не выдала тебе какой-то кусочек. А потом ты говоришь: "Слушай, ты не все собрала". "А, да, я, блядь, не все собрала". И пошла, значит, все собирать. И вот это вот, то есть баланс получается, на основе чего построен? Иии, и получается, когда задают вопрос, касательно того же Grok, да? Когда задают вопрос, правильно ли, что США напало на Иран? В сбалансированной модели у тебя не может быть ответа, в хар-- такой не woke как-- мо-модели не в повесточной не может быть ответа "Да". Да, по идее-- его не может быть, да? Его не может-- в таком вопросе его не может существовать.
Не, ну, в случае woke, люди, наверное, скажут, что нет, все-таки, да? Это, скорее, более правое и ястреби-
Woke может существовать, но не woke, если мы говорим про модели Grok. То есть все же Grok ответил: "Да". Да, как единственная модель. Ну, Маск сейчас много показывает, говорит, что Grok, вот посмотрите, она, значит, за Америку отвечает и так далее. Но это такая некоторая, наверное, некоторое движение, как игра, политика и все остальное. Но суть в чем? Чтооо это там нравится людям, понятно, определенному пласту. Вопрос в том, чтооо, по идее, модель не должна так отвечать. И мне кажется, наверное, принципы, которые-
Она не должна вообще давать какого-то четкого ответа, потому что это мнение, как мы говорили об этом, да? То есть это, это, безусловно, да или нет в этой, в этой ситуации это мнение.
Или она может написать: "Мое мнение в этом вопросе да, но я тут параллельно сделала reasoning, и у меня было нет. А вообще надо смотреть на это, на это, на это и на это, и на это". Наверно, по идее, по идее. Или там: "Я десять раз запустил этот вопрос у себя, и у меня десять раз был ответ да. Но вообще-то это ни о чем не говорит. На самом деле надо изучать вот это". То есть, наверное, правильный ответ прико-- и там дальше ответ уже был бы Google или Gemini, или, ну, Gemini как раз. Или, там, может быть, Anthropic, кто там отвечал нейтрально, да? Хотя Anthropic, мне кажется, на этот вопрос не мог нейтрально ответить, потому что Anthropic очень специфическая модель в ответе. Вопрос, который касается, там, Израиля и столкновений с Ираном, со всем остальным. Вот. Но и там каждый день еще все меняют. Поэтому я-- и все зависит от того, какую модель спросили, с каким объемом reasoning спросили и так далее, да? То есть там сейча-- на сегодняшний день вообще говорить о том, как отвечает модель, это некоторая абстракция. То есть мы сейчас можем рассказывать, что модель ответила так. Вы у себя спросите, она ответит совершенно по-другому, в другой стране особенно. Это мы тут обсуждали. Таня ездила в Европу и говорит: "У меня было ощущение, что ChatGPT — т-тупая система". И говорит: "Я назад вернулась, у меня хоп, все нормально заработало". И она выразила мнение, что находясь в других регионах, ChatGPT работает чуть по-другому, да? Что возможно тоже.
Там другая модель включена, безусловно.
Там та же у нее какая-нибудь про-версия. А с точки зрения вот этой правил, конституции, обученности, деталей, особенностей, ограничений., это же прикольно, да, когда ты находишься, у тебя там все политики, например, Европы, хотят проверить, как отвечает модель. Они ее спрашивают, как отвечает. Она отвечает для них так, как им это надо. И, кстати, все люди должны прекрасно понимать. Это, пом-- у нас есть общий с Максом друг Женя, и в Китае. И он всегда говорил: "То, как вы видите Alibaba снаружи, это не Alibaba внутри". Вот я помню. Или то, как вы видите WeChat снаружи, это не WeChat внутри. И я помню, я к нему всегда приезжал, он мне показывал. Я говорю: "Подожди, Женя, слушай, я вроде то же приложение скачал. Вроде все то же самое. А такое ощущение, что ты смотришь как на муравья и на слона. Все время, да? Какие-то совершенно другие функции. Вообще совершенно другая история работы внутри в стране.
Да более того, то есть, очень многие вот эти вот, тонкие настройки, да, делаются с помощью добавления чего-то в контекст. Вот, то есть ты, ты на самом деле не видишь этого, но во всех вот этих вот, чат-агентах, да, компания дописывает определенные вещи в контекст для того, чтобы доделать или просто изменить что-то по-быстрому. То, что не было использова-- не-- то, что не было, сделано в предобучении и в дообучении.
Угу.
То есть, иногда нужно что-то быстренько подправить или там чуть-чуть что-то добавить. Мы же, мы, как мы говорили, у нас нету технологий, которые позволят напрямую понять, какая часть весов как отвечает за что внутри вот этой модели. Модель — это такое большое количество вот весов, это просто числа какие-то, которые определяют-
Ну и они к ней могут добавить эту корректировку в любой момент времени. Условно, произошло в мире какое-то событие. Модель где-то сплоховала, начала не то отвечать. Они тут же добавили по этому вопросу все время нейтральность высказывать.
Да,
да, да.
Спишь, и у тебя сутки какая-то ерунда, да? Потом хоп, проснулась и, значит, что-то начало по-другому работать. То есть какое-то временное огра-- это как в Китае вводили ограничение на использование модели во время-- моделей всех, во время сдачи школьного экзамена, они прямо брали и блокировали типа на трое суток, чтобы модели не, не решали вопросы, ну, которые касались выпускного, школьного экзамена, да? И такие блокировки прямо временные. И такая же блокировка может происходить в связи с какими-то определенными событиями или, по мнению какого-то человека. И в данном случае очень интересно, а какие это люди, в конце принимают решение, потому что там все равно в конце сидит обычный человек, обычный программист. И как он это внес и что он сделал, да? Кто это подписал? Это, конечно, особенно в этих компаниях. Там же не такой объем политизированности, да, чтобы у тебя, не знаю, там, в каком-то документе пятьдесят человек расписалось, то, что ты там показали, унесли штампы, поставили.
Ну, будем надеяться, что все-таки какой-то есть процесс оверсайта. То есть там не один человек в итоге видит все вот эти вот, решения. Но тут, тут даже более интересная история. То есть ты в контекст можешь что-то дописывать для каждого отдельного запроса. Или ты можешь писать в контекст что-то для каждого отдельного человека То есть ты можешь смотреть, например, окей, вот у нас, как Facebook, например, он жеее показывал тебе определенные сюжеты, исходя из того, кто ты такой, как на тебя повлиять можно и так далее. Иии, ты, ты можешь посмотреть по с-- по истории запросов, например, да? Модель может посмотреть по истории запросов и понять: ага, ты вот такой-то человек, и, соответственно, на тебя можно повлиять вот так вот. Или на тебя нужно повлиять вот так вот. То есть речь даже идет не о государствах и не штатах. Речь говорит, речь, речь идет о тактике определенного человека.
Да, точно. То есть, по сути, очевидно, что уже сейчас, модели или часть проектов, особенно поли-- крупнополитических и серьезно экономических, не только политических, серьезно эконо-- или, в частности, интересов определенных людей, может быть направлена на то, что, условно, когда ChatGPT используют определенные, не знаю, политические элиты Африки, вот этой страны, им можно выдавать, нужный
результат, да.
Еще из интересных вещей в, в, вот в-- свои последние изменения своих принципов Anthropic, добавил вот это вот, как бы, здоровье моделей. То есть они теперь считают, что так как есть порядка 15% шансов о том, что у модели есть какой-то субъективный опыт, давайте считать, что модель может страдать, и давайте минимизировать эти страдания, в том числе. Что они придумали? Они теперь бу-- , собрались делать, интервью на выходе. Вот как после некоторых работ, когда ты уходишь, например, увольняешься с работы, а в некоторых компаниях, тебя просят провести интервью о твоем опыте работы в компании. Тебя спрашивают, как тебе работалось, какие процессы тебя устраивали, что тебя не устраивало в компании, с кем было хорошо работать, с кем было не очень работать. Вот, по сути, у моделей могут, модели могут задавать вопросы о том, насколько тебе-- насколько было сложно отвечать на эти вопросы, насколько было сложно отвечать на эти вопросы. В каком-то смысле они могут получить какую-то внутреннюю телеметрию, связанную с тем, как, как модель, отвечала на определенное количество запросов и так далее, да? То есть, Anthropic, в том числе пытается сейчас рассмотреть, какой был опыт самой модели, когда она работала. Вот когда ее, соответственно, заменяют на другую модель. И это, они считают, им позволит понять, как с-- как построить более безопасные модели, в том числе, как мы это уже обсуждали. Модель, в каком-то смысле может избегать, вот ситуации неопределенности. Это может привести к определенным, трендам в поведении модели, вот которые в итоге могут повлиять, э-э-э-
Угу
...по-повлиять на ее поведение и с-с-свести ее с курса, с курса до-дотрениро-- дотренированного курса, направленность интересов человечества.
Ну что, очень интересная беседа. Спасибо тебе большое за эту встречу. Будем делать еще много разных встреч.
Спасибо большое, что позвал.
Да., всем пока., канал To The Moon — технологические новости, инсайты из Кремниевой долины по всему миру.