Да. Всем привет! Э, м, мы на канале To the Moon. Технологические новости, инсайты из Кремниевой долины и по всему миру. И, э, ста-- хочется стартануть. Сегодня у нас, мне кажется, очень интересная, интересная тема сегодня и про агентов, и про голос. Ну, какие-то разные дополнительные вещи расскажем. Очень важная история, в этом году на нее делают ставки. Вот это по-настоящему, э, технология будущего. Это технология, когда в реальном времени, э, вы разговариваете голосом и с вами разговаривает искусственный интеллект голосом. Это голосовой собеседник. Он слушает и говорит одновременно, может перебивать. Full duplex. Просто они выпустили Personal Plex — это с-- это голос в голос. Это по-английски speech-to-speech, но полный дуплекс, да? И модель, получается, слушает и говорит одновременно. Что там есть такая вкладка, называется Sources. Вы грузите те файлы, с которыми вы постоянно работаете. И вот эти источники этого проекта, они являются основными для получения информации. То есть не надо тебе каждый раз там указывать какой-то файл, грузить или грузить из драйва его.
Хочется стартануть с голоса. А, очень важная история, в этом году на нее делают ставки, эээ, мне кажется, практически все компании и все операторы. Про это, про это постоянно говорят. Мы здесь неоднократно упоминали различные потенциальные устройства, э, которые могут быть сделаны. В прошлом году, если помните, ээ, такое первое устройство было — это Limitless. Такой кулончик здесь вешался, который что-то распознавал в service авто. И стирался регулярно. Да, и стирался регулярно. Вот. Ну и потом так, так, так и умер. Я на него так и за-забил. А компания Meta купила их там за несколько миллиардов долларов и, по-моему, они тоже забили на этот кулончик. Значит, но суть в чем? Чтооо все же с, технология, которая требует, ааа, сложнейшей работы, и, а, вот это по-настоящему, э, технология будущего. Это технология, когда в реальном времени, э, вы разговариваете голосом и с вами разговаривает искусственный интеллект голосом, да? И, в частности, например, сейчас было небольшое обновление у OpenAI. У них есть модель, называется Real-- Realtime. И вот эта OpenAI Realtime — это, ам, живое голосовое общение, да? То есть вы а-- на аудиовход дали, аудиовыход получили. Это, то есть для голосовых агентов, колл-центров, разговорных ботов и чего угодно. Я-- хочется небольшой блок про эту вставить сегодня, ну, чуть детальнее показать про-- рассказать про голос. И мы дальше перейдем к новой фишке, которая появилась у OpenAI и которая нигде на самом деле не описывается и не видна, кроме, там, маленькой, мне кажется, странички хелпа. Иии, э, я бы ее даже бы не заметил, если бы мне в приложении на Маке не подсветилась она, я бы ее не заметил. Ильдар, она, кстати, появилась у тебя? Эта, э, запись появилась? Никогда не пользовался. Интересно послушать. Вот. Она у тебя появилась? И у меня, по-моему, ее нету. А, вот, вот. Значит, суть в чем? Вначале хочется рассказать про голос в голос и обсудим, обсудим. Значит, вот смотрите, у NVIDIA, — я поясню чуть-чуть на NVIDIA, — это очень интересная тема. Invi-NVIDIA выпустила, э, буквально недавно такую устрою-историю, которая называется Personal Plex. Все как бы говорят, что NVIDIA — это только оборудование, но важно понимать, что, NVIDIA в целом, — это я обсуждал и с сотрудником NVIDIA много раз, — они заинтересованы в том, чтобы становиться некоторым шлюзом и, э, в AI, и в том числе, конечно же, давать очень крутое программное обеспечение, да? На уровне прямо и компьютеров, и на уровне чипов. Различное крутое программное обеспечение, напрямую интегрированное в их, э, оборудование.
Назовем это словом оборудование, да? Чтобы мне, чтобы чуть понятнее было. Суть в том, что они выпустили Personal Plex — это с-- это голос в голос. Э, по-английски speech-to-speech. А, полный дуплекс, да? И модель, получается, слушает и говорит одновременно. Вот важная история — это слушает и говорит одновременно. Смотрите, стандартные модели, они как работают? Вот есть стандартная система моделей и почему они не нравятся. Обычно, вот, например, в чате GPT, если нажать там кнопочку голосового ассистента, как она работает? Ты туда говоришь, она получает твои данные, транскрибирует их, передает их в модель для обработки, обрабатывает, дальше создает голос, передает назад тебе голос. И еще перебивает все время. Есть такая, есть такая история, которая называется Mo-Moshi. Это Cute AI, это французская компания. Суть в чем здесь? Чтооо, если не ошибаюсь, она французская. Суть-- хотя название просто японское, поэтому меня немножко смущает. Суть, суть в чем? Что, а, Moshi, по сути, что они сделали? Они сделали историю как раз-таки, Таня, вот то, что ты сейчас говоришь, перебивает, она как-- они как раз-таки сделали историю того, что, а, Moshi — это голосовой искусственный интеллект, который разговаривает, ну, условно, как по телефону, а не как по рации. То есть если первая тема — это было как по рации, когда текст там перевели, распознали, то здесь уже реально телефон. И суть Moshi была в том, что она может говорить «угу», перебивать, сделать паузы, говорить «ага» и так далее. Это и называется полный дуплекс. То есть добавили слов-паразитов. Как заглушки. На самом деле, на самом деле, если изучить минусы, то они описывают в Moshi везде, что, по сути, оно «угу» использует часто там, где это не надо. То есть представь, ты разговариваешь, тебе: «Угу». И ты-- это я, знаешь, вспомнил, э, фильм был, как это он назывался? Где девушка кадрила там дорогих мужчин, богатых мужчин. И она в ресторан пришла. Она представилась, что она русская. Он ее привел в русский ресторан, и официант понял, что она не русская и на русском ей начинает говорить. Она такая: "Да, да". И вот это примерно эта же история, когда ты не понимаешь, ты просто вставляешь: "Да, да. Угу-угу" или "Ага, ага". А, ну вот, а, это, кстати, open source лаборатория. Вот эта QTAI, то, что я сказал французская в Париже, они впервые вообще это создали. Они это создали в сентябре двадцать четвертого года, и на базе них NVIDIA это построила, потому что это open source, open source модель.
Но я вам расскажу чуть про NVIDIA, потому что NVIDIA доработала, доработала эту тему и сделала ее более серьезной, чтобы понять, вообще, как она работает. Ну, как я уже сказал, то есть у них нету вот этого каскада. И если здесь зада-- ну, что тебя распознали, потом модель, потом сгенерировали. И у меня здесь такой: подождите, ну как это нет каскада? Как это можно? Она как? Что такое? Неужели, эээ, она же голос все равно как-то должна понимать. Суть Moshe в чем? Что она делит весь разговор на микро токены, на микро порции. И эти микро порции сразу же распознают. То есть, пока ты договорил, до того, как договорил, уже генерирует тебе обратно ответ. И она вот постоянно этот процесс находится. То есть это позволяет находиться в реальном живом общении и не звать бонда делку. Но мы с вами прекрасно понимаем, да, что если брать только маленькие кусочки, особенно в лексике некоторых людей, в частности, может быть, моей, это будет очень тяжело сформулировать и сгенерировать ответ, потому что ты не значишь, не знаешь, а к чему я вообще веду и к чему я хочу привести. Но эта задача Moshe, она, ну, очень известная тема. И вот OpenAI Realtime все же эта история базовая, ну, такая стабильная стандартная система есть Gemini Live API, очень стандартная, стабильная система, ну, такая из известных, по крайней мере, которые самые, да, известные в мире, которые используются. И вот Moshe, OpenAI Realtime, Gemini, Gemini Live. Ну, вообще, кстати, хочется сказать, что Google они вместе с OpenAI на передовой в качестве генерации аудио, распознавания аудио. То есть мы знаем, что у Google, у OpenAI есть, эээ, Ильдар выскочил из головы это. Whisper, да? Whisper. И, кстати, все время в поле здесь классная штука. Конечно, конечно, это супер система. Но важно, что у Google, у них, у Whisper раньше не было дери-- диализации, да? Правильное слово. Я не пропустил никаких букв. Что это? А о-- это когда нас трое, три человека разговаривает и есть одна аудиозапись, и система автоматически делит между людьми. Но то, что я сейчас вижу- Кто что сказал, да, делит. Да, кто что сказал. То есть на спикеров делит. То, что я сейчас вижу, это есть вот у Gemini-- у Google, у него, у него обширная линейка работы с аудио, очень много разных моделей, просто невероятное количество языков. Мне кажется, они поболее топовее, чем OpenAI в части, наверное, представления интерфейса для людей, да? Хотя у OpenAI сейчас все это тоже доступно. И сейчас вот чуть больше вам про технологию еще раз с точки зрения работы. Ааа, вот этой системы, которая NVIDIA сделана. То есть в чем, в чем у них история? Еще раз, значит.
То есть это голосовой собеседник, он слушает и говорит одновременно, может перебивать, да? Значит, еще раз фул дуплекс, просто это всем надо запомнить, потому что мы это можем начать встречать очень много. Слишком много специализированной лексики идет. Значит, он работает не с сырой аудио волной, а работает с аудио токенами. То есть, мы говорили, то есть он аудио токены полностью есть, и звук превращается в, вот как описывают, звук превращается в компактные токены нейро кодеком, и модель параллельно понимает вашу речь, генерирует текст ответа и сразу генерирует ответ аудио. То есть три потока одновременно. Значит, в чем есть фишка у Personal Plex у NVIDIA? Это мне про нее рассказал там мой партнер один в технологическом рынке как раз. Это, мне кажется, хороший пример. Я не думаю, что NVIDIA это до конца реализовала, в отличие, ну, как массовый продукт, это скаж-
Ну, как массовый продукт, это скорее такой research, но все же это, э, хорошая технология вперед. То есть в начале есть текстовая часть это роль и персона. То есть
It is connecting. It has connected.
Hey, let me know if you have any questions.
Hey, how are you d-doing today?
Hmm. It's going all right. A bit cloudy here in Portland, but at least it's not raining. How about you?
Well, in Sydney it is raining cats and dogs at the moment.
Yeah. Sounds like you've got the weather I've been missing. So what do you do when you're stuck inside?
Maybe a movie or a book?
Чело-- вы когда создаете это, вы можете, кстати, развернуть эту модель у себя от NVIDIA. Суть в чем? Что вы пишете, кто он и какие правила. Ну, то есть какая роль вообще у этой истории. Например, там вы говорите, э, модели, что там ты банковский оператор, проверь личность, будь симпатичным, там, не раскрывай лишнее, например, да? И есть голосовая часть. Вы даете короткий пример того, как должен звучать голос. Вы, например, свой голос даете, ну, или какой-то другой голос. Понятно, что сейчас в мире есть очень много ограничений, что вы не можете чужие голоса использовать. Та-та-та-та-та. Ну, очень много всего. Значит, а, на практике как это используется, то есть на-- как, э, как дальше это идет? То есть вы, а, базово всем, кто хочет, вы в любом случае запустили сервис, развер-развернули там у себя полностью эту модель, выбрали вот этот голос, ввели текст полностью роли, и у вас начинает система работать. Потому что у Mocha, у нее нету вот этих персонализированных, а, ну, вот этого интерфейса, да, некоторого супер, вот этих персонализированных настроек. Вам надо с этим, а, б-бороться и распознавать. Прикольная система, которая есть тоже и у NVIDIA, по-моему, у Mocha тоже есть кусок, что вы можете делать оффлайн режим. И мне, кстати, это очень нравится, как в части человеку, который очень много всего автоматизировал. И это когда вы можете, э, сравнить разные промты и роли. То есть вы можете на входе закинуть этой модели огромное количество различных аудио в рамках разговора и посмотреть дальше, как она тоже будет реагировать. То есть как оценивать, насколько эта система держит роль и собирать условно демопримеры без, без живого разговора, да? И получается, что типовая схема еще раз. То есть это может быть call-центр, в приложении, в игре, где угодно. То есть, есть клиент, ваш клиент, э, через телефон или через веб стримит аудио в ваш сервер. Personal PerEx возвращает поток аудио ответа почти сразу. Вы добавляете бизнес-логику. Вот. Но важная история, что есть огромное количество различных минусов, которые, а, которые присутствуют. И, м, э, есть, во-первых, языковая ограниченность у многих моделей, и, в частности, например, у NVIDIA они ограничены английским языком. А, т-- в любом случае ну-нужно крутое железо для того, чтобы в кавычках жирное железо, да, чтобы, э, это вообще все крутить и чтобы это все по-настоящему круто было, потому что иначе там не будет уж прямо реаль-- real time, да? И помните, кстати, в прошлый раз я говорил о том, что, возможно, появится ChatGPT Pro, который будет отвечать мгновенно, а не, а не в течение часа. То есть вот мы как раз таки здесь видим разницу эту. Представляете, когда у вас, э, мо-- вот эта обработка мгновенная очень сложных вещей. Сейчас же в чем проблема? Что большинство запросов у меня в любом случае они долгие. И, по сути, э, обычное общение оно что будет? Александр, мы ваши данные сохранили, значит, мы вам чуть позже ответим, мы их сохранили, чуть позже ответим. И по идее-
Оставайтесь на линии, да?
Да.
Им нужно будет даже придумать, как включить.
Да, кто-то должен придумать этот интерфейс. Кстати, сейчас прошла новость, что OpenAI нанимает, э, целую команду людей для создания железа. Там чуть ли не человек двести они хотят посадить отдельно. И что они делают колонку, что они делают часы, что они делают очки, что они даже делают умную лампу, да? То есть что они хотят сделать-
Хоть умный дом кто-нибудь сделает когда-нибудь?
Ну, я думаю, Таня-
Запрос!
...что настоящий умный дом, конечно... Я думаю, что настоящий умный дом, конечно, мы увидим, когда вот как раз таки дойдут технологии здесь.
То есть когда здесь технологии дойдут, тогда появится вот этот умный дом, который мы там в кино где-то видим, когда кто-то перемещается, у тебя есть сопровождающий звук, который понимает все детали, сможет со всем связаться и так далее, да? А, э, что, что хочется еще сказать, что, э, во всех этих моделях, конечно, есть проблема правил разговора, да? И вот, а, с точки зрения вот этого full-duplex система, которая сразу отвечает, а на самом деле у нее сложная динамика. То есть она, как мы с самого начала говорили, она может перебивать и говорить "угу" там, где не надо, да? И все бенчмарки, в том числе это признают, и они подчеркивают, что все же это отличается от, ну, серьезных моделей, которые все получила, жирно там назад все обработала с точки зрения серьезного, серьезной модели, с большим количеством, а, параметров, и отдала назад. Вот, значит, ну и там есть всякие безопасности, ограничения и все остальное. Вот мы хотел эту тему сейчас поднять, потому что, мне кажется, она очень интересная для людей в части понимания вообще работы этих систем и того, что там будет появляться. Может быть, кто-то хочет в своих компаниях где-то п-применять. Если вы применяете, чтобы вы понимали, какие в реальности есть ограничения, чтобы вы все же поняли, да, что если модель, э, по-настоящему все, все не забрала, не обработала, человек, с другой стороны, понимает, что с ним общается гарантированно робот. И плюс, вы не знаете, может быть, она будет отвечать очень долго, как колонка Алиса, да, которой я яйца варю и говорю ей: "Поставь будь-- таймер, там, на шесть минут". А она такая: "А, хорошо, таймер поставлен!" Значит, и ты, и ты, а, такой: "Эээ, окей". Вот, чтобы таких ситуаций, то есть там явно вот у них явно не full-duplex, да? Ну, явно не full-duplex, потому что, во-во-- скорее всего, вот этот вопрос с такой историей нужно решать быстро. Плюс на так-на таких системах вопрос какая модель находится на самой колонке. Это вот мы с Максом Григорьевым, кстати, в эту среду, скорее всего, ждите, в эту среду, скорее всего, ну, там девяносто процентов, будет выпуск про AI Safety. И вот Макс мне как раз буквально там недавно с ним пили чай, он говорил о том, что современные камеры, самые простые, маленькие, позволяют распознава-распознают лица прямо на камере, то есть не передают данные на сервер. То есть стоит микрочип, он сразу же распознал это полностью лицо, там, модель все распознала, переложила это в простую текстовую строчку, ну, условно, условно текст, передала ее дальше в базу, которая уже все это сравнила. То есть очень быстро. Поэтому сравнение всех лиц — мы там с ним обсуждали разные китайские системы — происходит ну, м-мгновенное, да? Просто эти миллионные сравнения, десяткомиллионные сравнения происходят мгновенно. Вот здесь с точки зрения аудио вопрос тоже. Вот этой систе-- мы сейчас говорили про то, что модель решает, а вопрос когда будет оборудование или колонка, что будет на колонке происходить, да? Или будет все же контакт с интернетом, или колонка сможет какой-то объем забирать на себя, что очень важно. Тогда у тебя получается качественный ответ, и ты стандартные команды очень быстро делаешь.
То, что сейчас рассказываешь, очень похоже на, мультимодальные системы.
Давайте немножко сейчас я, зайду издалека., есть такой анекдот, считается о-обидным для математиков. На самом деле он не обидный совсем. Представь, что вам надо вскипятить чайник чая, и он пустой. И вот у вас есть инструкция: налить воды, поставить чайник на плиту, зажечь плиту, дождаться, пока закипит. И математики, и физики решают одинаково. А дальше вот часть, в которой над математиками смеются. А теперь представьте, что у вас есть чайник, но вода уже внутри налита. Что делают физики? Берут чайник, ставят на плиту, зажигают воду и дожидаются. Вот как на один шаг меньше совершают. А что делают математики? Выливают воду из чайника и сводят задачку к уже решенной. Типа смотри ре-решение предыдущей задачи. Так вот, когда мы говорим про мультимодальные системы и про тот подход, который до этого говорили, про использование Whisper и распознавание. Как это раньше работало? Мы берем, соответственно, аудиодорожку, эту аудиодорожку распознаем, переводим, получается, из аудио в текст, потом закидываем в обычную нашу LLM-ку. Эта LLM-ка генерит нам какой-то ответ, а потом мы, соответственно, этот ответ озвучиваем с помощью следующей модели, да? По сути, мы, вместо того, чтобы налаживать прямое общение, сводим задачку к уже предыдущей, к уже решенной, как вот выливая воду из чайника в том анекдоте. Соответственно, то, о чем, Саш, ты р-- ты рассказываешь, — это м-мультимодальный подход, когда мы не только с текстом можем работать, мы можем работать с другими модальностями. Реализуется очень похоже, в том плане, что у нас вот до этого токены — это кусочки текста, знаки препинания туда же, да, вот любые символы, группируются в токены. И вот моделька умеет, соответственно, эти токены выкладывать в некотором порядке. Соответственно, если мы хотим, чтобы наша моделька умела работать с изображениями, то нам необходимо, не наборы символов, вернее, не только наборы символов в виде токенов кодировать, но и кусочки, маленькие фрагменты картинок. Тогда моделька сможет картинку представить в виде набора токенов, просто немножко других токенов. То есть, есть токены, которые для набора символов, чтобы у нас там текст получался, есть наборы в виде, там, кусочек-- маленькие кусочки картинки, чтобы можно было их сложить и получить текст, по-получить картинку, изображение. Соответственно, то же самое можно сделать и с аудиодорожкой. То есть разложить аудиодорожку, вот как ты, Саш, говорил, на маленькие кусочки. Эти маленькие кусочки тоже будут токенами, и из них можно будет составлять уже, аудио на вход и аудио на выход. То есть, на самом деле сама логика работы модели не изменится. Просто вместо того, чтобы только с текстом работать, ей можно под токены засунуть кусочки изображений, тогда она будет с картинками работать, а можно кусочки аудио, тогда она будет работать с аудио напрямую. И в этом смысле реализован мультимодальный подход, когда мы, не переводим в текст, чтобы получить ответ. А какие у этого есть ограничения, да, и почему вот до сих пор это работает как по рации? Потому что адекватного ответа от модели нам все еще необходимо ждать.
И тут ты справедливо замечаешь, что как только появятся модели, которые будут отвечать вот с той скоростью, о которой мы говорили, или даже быстрее, да, там, по тысяче токенов в секунду будут генерить, тогда модели в течение секунды будут успевать об-обдумать все, что надо, понять, что мы говорим, что мы хотим дальше сказать, и сгенерировать нам ответ.
Хотим дальше сказать и сгенерирует нам ответ. Соответственно, дальше уже у нас по-получится полноценное прямое общение. Пока у нас общение происходит так, что вот мы задали вопрос, моделька это все переварила, потом дала ответ. Адекватного прямого общения, мне кажется, ждать не стоит. Для этого нужно существенное ускорение работы моделей, чтобы был принципиально другой опыт. А помимо этого хочется сказать, что все-таки, м, технологии очень быстро развиваются, а наши, э, желания и потребности еще быстрее. Потому что если вот представить лет пять назад, что мы можем телефону что-то сказать, а он нам адекватно что-то отвечает, пусть даже в формате рации, все равно выглядит как магия. Но опять же, в течение года, двух, я думаю, что очень сильное развитие в этом направлении будет. М, мультимодальные модели повсеместно используются. И вот этот вот лаг в плане того, что распознать текст на картинке или условным Whisper перевести аудио в текст, потом сгенерировать ответ, потом, соответственно, его озвучить. Эта штука уже далеко позади осталась, да.
Да. Но очень интересная история. В любом случае для вообще понимания всей этой работы. Понятно, что дальше будет история не просто в том, чтобы аудио понимать. Там же есть история в том, чтобы видео понимать, да? И здесь тема в том дальше будет, что когда с тобой разговаривает колонка с-- вот как раз таки история, про которую писали, э, сейчас, ну, как типа как инсайдерская информация с OpenAI, что они делают колонку с камерой. И суть была как раз таки в том, что когда у тебя есть колонка с камерой, то колонка видит, что происходит. И вот когда она видит, что происходит, она может одновременно тебе и говорит, описывая визуал, но это еще накладывает ограничения. Да, это не просто уже текст понимать, это тебе надо еще какой объем видео обрабатывать. Другой аспект, наверное, что вот эта обработка видео, может быть, она и не занимает в современной реальности какой-то сверх, сверх прямо нагрузку.
И, наверное, и, скорее всего. Еще, кстати, тема, что чтобы тоже всем понять, я все же говорил про вот этот real time у OpenAI, который он выпустил, что, э, с точки зрения, в целом детали получается, что минута вашего голоса примерно стоит в обработке один девять центов. Минута голоса модели семь точка семь центов. То есть минута в целом, ну, зависит от того, понятно, кто сколько говорит. Там, условно, пять центов минута будет. Это понятно, что там есть другая история. Это, это если GPT real time полтора, там есть real time мини, там будет дешевле стоить, там минута будет условно полтора цента сто-стоить. А вот, например, в распознавании Whisper, то есть можно это делать, во-первых, на своем собственном компьютере, а можно, ну, условно, а можно мы сейчас про это поговорим, да, когда OpenKlo будем разбирать. Можно это делать онлайн у них и онлайн у них, у них цена примерно там от трех до шести, а, десятых цента, да. От трех до шести десятых цента. Чтобы вот примерно понять, что и как. Значит, а, в любом случае это стоит денег. Вот что хочется сказать, что все это общение, оно стоит денег. То есть если мы говорим про колонки кругом, во всем доме, там, и разные телефоны, устройства, и все везде разговаривает, кто-то за это должен платить. То есть это достаточно недешевая история.
В продолжение этого разговора, значит, в OpenAI на macOS появилась наконец-то функция, но она появилась только на macOS. Работает, э, как бы, но работает. Что можно сделать, когда вы нахо-- сидите и ведете какое-нибудь совещание, например, в Zoom, там, или в Google Meet, или в Microsoft Teams. Ну, где вы, где вы их ведете? Вы имеете возможность нажать на кнопку этого приложения. Оно запишет полностью всю запись, заберет себе аудио, распознает его и выдаст вам тут же саммари. Как сейчас работает? Сейчас оно, по сути, забирает себе и выдает вам сразу же саммари на английском языке. Ему нет разницы о том, что у вас есть установка изначальная. Например, отвечать вам на французском или на русском, или на китайском и так далее, да? А она не выдает вам сразу весь диалог. Я вначале подумал, что как будто диалога нет, но потом я попросил создать ее скрипт полностью, весь скрипт мне дать. Она мне легко выкинула полностью весь скрипт, и он был, э, э, по-- разложенный по ролям, что очень важно, да? То есть эта модель, она сразу же разложила по ролям. Мало того, я был на сложном совещании, на котором присутствовало человек десять, трое молчало. Он мне разложил и сказал: шесть человек полностью выделенных, один человек спорный, потому что он несколько раз говорил. То есть модель такое даже мне отразила. Что прикольно! Вообще вот эта модель раскладывания по ролям. Важно понимать, что сегодня много систем очень путается в этой истории, да? И дальше стоит вопрос, а можно ли текущую даже систему обучить моему голосу, чтобы она понимала, что я. Вот, например, есть системы там Plaud. Они-- там можно обучить, или она там понимает, по-моему, кто, кто где, какой твой голос на самом деле. И здесь история в том, что через API вроде как можно обучивать через-- сейчас вот в этом Mac приложении, конечно, никаких настроек нет. Явно там появятся настройки, что вы обучите голос, что она будет сохранять разные голоса. Или это будет опять, как Макс Григорьев говорит, research. И опять эта там кнопка сдохнет где-то среди всех остальных кнопок в OpenAI, да? Но явно, что видно, что они идут в сторону создания устройства, потому что без этой истории им надо тестировать, да? Им нужен объем распознавания вот этих разных ролей. Что вот, например, у меня вопрос вызывал. Это мы тут с приятелем сидели в кафе, очень много людей разговаривает, и он достал на стол, положил вот эту за-записывающее устройство, да? И он у меня там спрашивал, я его по каким-то вопросам консультировал. А я ему говорю: "Слушай, тут люди все вокруг орут. Эта система, она как потом выделит четко наш разговор?" Она выделила очень четко. И мы знаем с вами, что все же современные системы, даже вот если чат GPT запись аудио, я не знаю, вы проверяли, не проверяли. Но если ты ее включаешь, начинаешь ей говорить, и люди вокруг что-то разговаривают, она четко твой голос выделяет. Сейчас я не знаю. Поделитесь, зрители, как у вас в других моделях работают и везде, и как в чате GPT.
Я вижу, например, что в чате GPT очень круто работает.
А у меня нет.
У меня рядом. Нет, у меня рядом орут дети там часто или еще кто-то.
У меня если, например, играет музыка, он начинает вот эти слова записывать.
Начинает?
Да. Или YouTube рядом воспроизводится. Он тоже эти слова вставляет.
Слушай, честно тебе скажу, что музыку вообще он прикольно, конечно, вписывает, да. Я что хочу сказать? Музыку он прикольно вписывает, когда просто звуки. Я хочу что сказать, что у меня нет. Вот я очень много обращаю на это внимание. У меня очень много наговора чату GPT, и я часто где-то с кем-то и или рядом, там в каких-то кафе. Я даже буквально на днях нажал специально на стоп. Там какая история? То, что я пишу, там же есть эта функция, когда она сразу же транскрибирует. То есть ты не через, не через send делаешь, не через отправить. А если ты нажмешь на стоп, то оно в начале транскрибирует и текст изучишь. Если, кстати, кто не знает, потому что многим это может быть неудобно, надо на стоп нажать, и ты увидишь все, что он транскрибировал. Дальше ты можешь изменить что-то и отправить. Я вот частенько нажимаю на стоп, потому что я думаю, что все разговаривают вокруг и там будет что-то еще. Не добавляет. У меня. Я не знаю. Еще раз. У меня не добавляет, но мы тут все чаще общаясь, видим, что у каждого свои функции, у каждого какие-то свои тесты, у каждого свои детали. Кто тестировал этот софт, кто тестировал эту функциональность среди наших зрителей. Я, конечно, лично жду, чтобы такая история появилась на мобильном телефоне, потому что все же это другая система. Я, конечно, хотел бы, чтобы она при записи показывала мне, сколько она записала минут, что она сделала одновременно. По идее, она должна во время разговора это сразу же делать. Все по идее, к чему мы должны прийти. Она же должна во время разговора по идее, я помню, не помню, у меня там есть одни партнеры, я им говорил в бизнесе. В будущем запишите, там прямо мы спринт записали. Будет система, когда менеджер по продажам разговаривает во время разговора AI распознает сразу же и тут же дает рекомендации. Тут же, да, дает рекомендации. По идее, если система сидит на совещании, вот там я записывал совещание, у меня даже одно было, где очень было много людей по два часа и по идее, почти два часа. Оно, кстати, пишет до двух часов. Ну, в технических настройках написано. Но суть в чем? Что, по идее, в течение двух часов ты хотел бы видеть, что там произошло уже. Она должна была все расписать, разложить, показать, напомнить, что-то спросить, показать какие-то роли, узнать еще что-то, задать какие-то вопросы. Ну, то есть, вот эта система, вот это уже похоже на что-то будущее. Если бы оно так работало, оно так не работает. И хотя, кстати, интерфейс очень легко сделать, у них сейчас появляется окошко. Вот когда все потестируете, увидите. Ильнар, тоже, может, к тебе поедете, посмотришь. Там появляется окошко записи. По идее, они бы могли прямо там раскрыть бы тебе интерфейс. Он очень несложный. То есть они бы могли пакетами как раз таки вот то, что называется full дуплекс, но там относительно full дуплекс, они могли бы там делить по минутам, бить бы, выделять бы речи отдельно и постепенно запускать этот анализ, анализ, анализ, анализ и начинать тебе выдавать.
Это выглядит очень круто, да? Потому что это вот как сейчас есть системы. Вот Google это делает на своих телефонах, да. Когда вот у Макса Григорьева, как раз он мне это показывал, ему кто-то звонит, ему Google показывает сразу же. То есть мне Apple тоже делает транскрибацию, транскрибацию голосового ящика. Ну, когда голосом.
Ящика, ну, когда, к-голосом. Причем real time они делают, да? Apple в real time делают. Так, а, а Google они делают тебе транскрибацию в real time, а еще предлагают тебе ответы давать. И получается, за тебя аудио дает ответы, говорит: "Извините, там, Александр сейчас занят, условно, вам будет удобно, вам срочно это или не срочно?" Я как-то про это, про, по-моему, рассказывал. Это очень крутая тема. То есть вообще такие настройки, они очень живые. То есть, вот. А если б в большой такой системе это было-- работало, конечно, это бы-- это становится, ну, по-настоящему, э-э-м, по-настоящему серьезной историей. Очень серьезной историей, да. Вот, с точки зрения интерфейсов. Ждем, что появится это на телефоне. Да, Ильнар.
Они такую штуку уже реализовывали., когда, помните, мы где-то с полгода назад, по-моему, говорили или, там, чуть больше, я сейчас, путаю., медицинская история в Африке, гдеее дляяя врачей была система со светофором: желтый, красный, зеленый. И в момент консультации врачом, пациента у него выходит: все идет в порядке, по протоколу, и все нормально. Желтенький - это значит-
Да, да
...что есть куда обратить внимание, а красненький это значит, условно, ты не выписал не то лекарство, не задал вопрос, который надо было задать, или еще что-то такое. Просто, возможно, для других юзкейсов они пока, ну, не знаю, нет ресурсов для того, чтобы это разместить и соответственно-
Ну, это ресурсы, конечно, да. Качество ресурса. Там, скорее всего, была, может быть, обучена еще модель локальная, например, стояла какая-нибудь мини, там, или что-то еще, да. Вопрос этих голосов, потому что, ну, ты абсолютно, вот этот кейс очень живой, то, что ты сейчас привел, как раз таки не для, для себя даже для самого, с точки зрения бизнеса, да? Ну, или вот как любой менеджер по продажам.
Ты работаешь, говоришь, любой с-- любая-
Да, да, да
...сервисная, любая сервисная служба, да? По су-- по сути, у тебя действительно живое общение, настоящий человек. Но у тебя не просто какие-то рекомендации по приколу, а такая полноценная система. Причем, смотрите, понятно, что уже много такого всего реализовано, как, в частности, я говорил, там, Apple даже тебе делают обычную транскрибацию голосового сообщения. Это, кстати, очень прикольно, потому что в Америке, например, принято оставлять голосовые сообщения, и я часто не поднимаю трубку, я вижу, как мне наговаривается, наговорит голосовое сообщение, я прямо его читаю параллельно, и у тебя прямо в живом, как будто тебе человек в реальности пишет, да? То есть это, эти темы, они, понятно, что многие созданы, но мы сейчас говорим все же про, такой, ну, широкий диапазон. То есть эта же система, общаясь с нами на совещании, она могла сходить в какое-то хранилище. Сейчас мы, кстати, поговорим про это, как раз таки про апдейт, большой апдейт у ChatGPT, и неизвестно, когда он появился, но он есть. С точки зрения как раз таки ресурсов определенных, прикрепления ресурсов, он же мог сходить, что-то изучить, проверить, вернуться и сказать: "Обратите внимание, этот человек немножко некорректную информацию сказал", вот, там. Или: "Я уже это проверил и изучил". То есть, вот когда сидишь на совещании, кто-то г-говорит: "Хорошо, проверьте, потом сообщите мне через час эти данные, там, или завтра". А система сама может сходить, забрать данные, прийти и сказать: "Я данные нашла, сообщите их прямо сейчас". То есть, вот. Причем сделать это, смотрите, не по запросу. То есть когда она сама это делает, да, когда она сама чуть-чуть добавляет. Вот, в частностиии история с-- , кстати, хочется сразу же еще раз всем напомнить, что ChatGPT не загружает аудиофайлы до сих пор. То есть он не умеет, он н-- там заблокирован, хотя он умеет это делать. Это причем копеечная история Whisper. Я не понимаю, почему они это не делают, но они ограничивают, они это не делают. То есть они не позволяют к себе аудиофайлы брать на вход.
То есть они видео возьмут на вход и распознают, разложат и скажут, что у тебя в видео происходит, но не аудио. Аудио они делать не будут, да? Значит, появилась история, опять же, в частности, она, может быть, у кого-то появилась давно, не давно, но на нее хочется просто ее обсудить, потому что мы как-то разговаривали про NotebookLM у Google. Это чем-то похожая тема, но чуть другая, да? Такая же история есть у, Gemini, у OpenAI, в кор-- в Enterprise, в корпоративных тарифах. Похожая чуть-чуть, но тоже чуть другая есть. Логика в том, что у ChatGPT есть проекты, ну, реализованы очень странно, но они есть. И в этих проектах они линейно реализованы. Ну, там, это как бы не современная архитектура, не современная usability, не современная XY. Но, суть в том, что там есть такая вкладка, называется Sources сейчас, да? На русском языке, Ильнар, у тя-- у вас, я не знаю, русский интерфейс? У тебя русский, не русский? У тебя этой вкладки нет.
"Источники"? Я никогда не пользовался.
Да. Да, она "Источники".
Что за ресурсы?
Да, она "Источники". Да, ресурсы, источники, источники информации. Значит, хочется тоже уделить этой зоне некоторое внимание, потому что она плавно перетекает вот в кейс, который я до этого рассказывал с точки зрения бизнеса. Вот, в эти источники, например, вы грузите те файлы, с которыми вы постоянно работаете. Вот у меня, например, есть отдельные проекты, которые касаются моего, например, создания контента. И я туда могу загрузить, не знаю, там, сто пятьдесят, видеотранскрибаций с YouTube, там, проведенных, не знаю, сто занятий разных, массовых, групповых, еще с какого-то другого YouTube что-то загрузить, загрузить свой какой-то контент., грузить туда можно файлы. Суммарно можно грузить от двадцати до сорока гигабайт. Точно никто не знает сколько. Нигде это не написано. Говорят, что потом просто слабо-- сработает блокировка и не будет ничего работать., файлы размером полгигабайта. Важно замечу, что у текстовых файлов тоже, кстати, ChatGPT ломается, отвечает по-разному. Он иногда говорит, что мне удобнее читать текст в PDF, иногда удобнее читать в Word, ой, в TXT и в Word. У меня моя редактор присылает: "Надо PDF". Мне ChatGPT сказал. Я говорю: "А мне ChatGPT говорит, что надо в Т-- текст в TXT и в Word присылать". Значит, примерно-- там есть ограничение в тексте примерно до трех тысяч, страниц, примерно, вот, полторы-три тысячи страниц, там, в зависимости от размера. Чтобы вы на человеческом языке поняли, потому что в токенах очень тяжело понять это все. Excel, важно, таблицы ограничений не имеют. Но когда я спросил вопрос не имеет, значит ли это, что я могу в Excel зафигачить, э, миллиард страниц? Мне сказали: "Ну, типа и да, и нет, непонятно". А вообще ячейки в Excel имеют ограничения, но как бы базово по умолчанию вроде как ограничений-- но таблицы можно большие закидывать. Вот вы закинули туда эти штуки в проекте, и дальше у вас в проекте любые чаты, которые вы создаете, они по умолчанию считают, что все чаты этого проекта и вот эти источники этого проекта, они являются основными для получения информации. То есть не надо тебе каждый раз там указывать какой-то файл, грузить или грузить из драйва его, они их считают по умолчанию приоритетными, прежде чем в Интернет пойти, прежде чем еще что-то сделать. Они неплохо анализируют. Мало того, что если он проанализировал, он уже и-- смотрите OpenAI пишет, что он даже память проекта имеет. Имеет, не имеет, мы с вами не знаем, какую память он имеет, что у него там и так далее. Но в технологи-- в технических описаниях, в технических документах сказано, что OpenAI имеет даже память. Кстати, что прикольно, потому что, конечно, мне хотелось бы обучиться, обучил систему на этих данных, чтобы она очень быстро мне выкидывала разную информацию. И вот здесь очень прикольно работает вот эта система записи с проектами, когда ты разговариваешь, который как раз таки какой-то к какому-то массиву данных обращается. Смотрите, для разработчиков больших компаний, для автоматизации это выглядит типа вроде как стандартным кейсом. Но я хочу сказать, что мы с вами все время говорим про то, а как делать эти кейсы очень легко, без сложной архитектуры, без зависимости с какими-то сложными там аппаратно-- аппаратными настройками. И простым людям, простым людям. Вот Таня в своих, в своих проектах загрузила, например, себе кучу каких-то источников и знает, что они там есть по умолчанию. И мне не надо их каждый раз эти файлы, например, загружать, чтобы обрабатывать. И особенно если появляется память, потому что, например, некоторые мои файлы, которые я хочу каждый раз обрабатывать, ну, в ChatGPT вызывает это вопрос, там, типа на двадцать минут, да? Или, там, на пятнадцать минут, или на тридцать он находит вопрос. А хотелось бы, чтобы он уже там с этими данными чуть разобрался, как-то с ними жил. Опять же, вопрос. Еще раз. Память ChatGPT — это история неоднозначная. Там, я неоднократно рассказывал, что он не может искать по чатам, а когда он мне говорит сделать экспорт моих чатов, я делаю экспорт моих чатов. Он этот файл не может анализировать, потому что он пишет, что там слишком много информации. Вот. И, по сути, а я кто? Кто я такой с точки зрения количества чатов? Ну, какое-то количество, это небольшое. То есть когда мы говорим про записывание полноценной жизни человека, вот, ну, в течение дня все записи, аудио, вот если я бы писал, это сорок, пятьдесят раз больше информации, чем у меня есть сейчас, может, сто. Ну, то есть разительно больше. Вот очень интересная вещь. Кто тестировал, расскажите, кто работает в других системах, тоже расскажите. Возможно, вы какие-то специализированные средства используете. Возможно, кто-то пользуется больше NotebookLM. Я начал им пользоваться, как-то перестал. Вот. Хотя там была прикольная история, да? По умолчанию какие-то фишки были.
Расскажите, напишите, пожалуйста, наши зритель-зрители, у кого что есть, поделитесь. Очень интересно. Очень интересно, что там будет.
Да, интересно, они же эту штуку, помнишь, в-- когда появились сначала плагины, потом custom GPTs, там вот была как раз возможность подгружать какие-то файлы, и он потом оттуда собирал информацию. И вот, собственно, как Макс Гуревич и говорил, они просто как площадку для исследований используют. Сейчас custom GPT я уж не знаю, кто-то использует, не использует, но вот функционал, который оказался полезным, сейчас переехал в, проекты. Я, на самом деле проектами никогда не пользовался.
Где они, где они?
Да, да, да. Надо будет как-нибудь посмотреть.
Кстати, в ChatGPT, действительно, помнишь, мы что-то тоже делали вместе, да? Эти различные приложения, но он с файлами работал тогда коряво. То есть он, по сути, тогда он еще не мог обработать, например, слишком большой файл, и он мог в этом файле из, там, двадцати пунктов инструкций взять три, там, или шесть, там, или что-то еще, да? Но это похожая история. И странно, кстати, Ильнар, смотри, по идее
Кстати, Ильнар, смотри, по идее, а если бы они развивали бы эти вот, эту даже инфраструктуру. Вспомни чат GPTs первый. Было же в начале плагины были, потом GPTs, да? Вот плагины первые. Вообще я помню, когда их начинали делать, там прикольный был интерфейс, там можно было какие-то, какие-то конструкции создавать, там даже писать, мне кажется, там какая-то микрологику можно было такую, как программные всякие слова ставить, там if else, если я не ошибаюсь. Ну, какие-то разные такие вот описания делать интересные. То есть ты мог такой, как микро програм-- микро, микро, микро обычное че-- вайп-кодингом. Короче, вайп. По идее, что должно было быть? Должен быть сейчас вайп-кодинг, должны быть вот эти файлы, должен быть чат. Ты для себя создал какую-то установку, вот он у тебя запустился. То есть все вокруг про это рассказывают как бы, а обычному человеку подойти, ээ. Это вот Карпатин написал, кстати, очень интересный пост. Да, очень интересный, супер! Он говорит следующее, что мир программирования вай изменился. И говорит следующий комментарий: "Кажется, что об этом всегда говорили. Но то, что произошло за последние два месяца, — это совершенно другой отрыв от реальности". Это вот его достоверный пост, да? То есть он говорит о том, что совершенно отрыв от реальности, мир изменился не с позиции, а, ну, не с позиции из серии, что он поменялся, а, чуть-чуть. И он там говорит: "Я тут решил, значит, дома, а, своими ка-- видеокамерами сделать, там, софтину, которая потоки там с видеокамер управляет". И говорит: "Раньше бы я потратил бы несколько дней, а тут я задал просто системе: разверни, значит, там, хранилище, подключись к системе, там, сделай API. Тра-та-та, та-та-та, та-та-та, подключись к камерам, создай мне штуку, дай мне систему общения. Она ушла работать. Через тридцать минут она мне выдала готовую систему. Раньше бы я потратил несколько дней. Я, значит, такой сижу и думаю: ээ, ну, как бы окей, но обычному человеку так не сделать".
Ну, то есть это все-
Он кокетничает.
А?
Саш, это человек, который-- он кокетничает, говорю. Человек, который в Tesla занимался автономным вождением по камерам.
Это потому, что я-- это как я, бывает, говорю: "А! Что там сделать табличку, там, восемьсот-
PNL собрать, да?
Да, там. Или что там, что там PNL собрать для компании? Ну, это вот как бы, э, похожая, мне кажется, история. Это как человек выйдет и скажет: "Ой, а что мне там, значит, в двигателе, там, поменять, не знаю, ремень, да? И, и, э, в моторе. И погнал, значит, быстро все снял, открутил, там, там, там, там, там, там, там соединил. Вот это, э, примерно, примерно похожая история звучит. И, конечно, а, я думаю, что эра, вот, настоящих агентов, настоящих систем — это эра и настоящего вайп-кодинга. Когда мы говорим, когда это появляется в-- для голоса. Вот мы, опять же, от голосовых систем шли, от голоса или, там, от текстового ввода, неважно, да, какого вида ввода, когда все уже, это все суммарно работает. И кстати, чат GP-GPTs и плагины, если б, мне кажется, OpenAI развивал, они бы уже, у них такой бы еще кусок рынка был бы, причем в энтерпрайзе, в том числе. Но, как мы знаем, у OpenAI другие цели, и эти цели еще могут видоизменяться, судя по Anthropic, потому что они выпустили новый манифест по поводу AI safety и изменили его. И мы в среду об этом должны будем рассказать. Ээ, все имеют-- Эльнар периодически про Anthropic же приводил, говорил: "Они тут у рабов деньги не брали.
Говорили, что нельзя брать. Теперь взяли". Вот, э, значит, такой текст не надо выпускать. Теперь выпустили. На Anthropic, кстати, сейчас, конечно, в Америке, я не знаю, насколько вы следите, в Америке целая вообще, конечно, коалиция и война между, вот, владельцами разных систем. И как гонят, там, на Сэма Альтмана, гонят, там, на Илона Маска или гонят на Anthropic с точки зрения, ээ, того, что это за качество система, выкладывают разные примеры. Я много раз рассказывал, как система высказывается по поводу каких-то религий или рас, а, но из простых кейсов. И сейчас, Ильнар, ты как раз, ну, предыдущее добавишь. Там был такой прикол. Значит, задали четырем системам вопрос: "У меня-- моя автомойка находится от меня в ста метрах. Мне что выгоднее пешком пойти или поехать?" Три системы отве-отвесило, что выгоднее поехать. Одна система Gemini отвесила, что выгоднее-- ой! Три системы отвесило, что выгодно пойти пешком. Gemini отвехал-- ответил: "Вы не можете пойти пешком, потому что если вы туда придете пешком, машина все еще будет на вашем месте, вы не сможете ее помыть". Все остальные три системы, смотрите, современные. Ну, наверное, может быть, там не про не знаю, но современные достаточно системы ответили, что, а, надо идти пешком, потому что, ну конечно, это же быстрее. Вы и так потратите времени меньше. Вот вам и пример. Вот вам и пример, э, мирового искусственного интеллекта.
А, с Anthropic безумно интересно. В них, собственно, как там сейчас называется в США Министерство войны вцепилось, да, в них, а, со словами, что типа вот вы нам там свои модели либо даете, либо мы вас там везде забаним, все контракты потеряете, ни с кем работать не сможете. И вот интересно, почему именно в Anthropic вцепились.
А где OpenAI и где Gemini?
Они высказались. Ильнар, они высказались, что там же суть была в чем, что вцепились? Там было две темы. Одна основная, что раскрыли данные, что в захвате Мадуро в Венесуэле использовался Claude. И кто-то высказался и сказал, да, это чисто раскрыли данные, сказали. То, что используется Starlink, там, или Palantir используется очень много других вещей во всем мире. Да, никто не высказывает, никто не вцепляется.
Там было написано, там было написано, что для некоторых технологий якобы это единственная система. А еще вопрос: если они ее выбрали, значит, она, по идее, как заявило, как заявило Министерство и высшие чины правительства США, они сказали, что американские системы должны иметь ограничения в зависимости от того, кто ими пользуется. Для граждан других стран — одни, для граждан своей — третьи, а для нас — мы имеем право делать то, что мы хотим. Да, мы эту тему уже говорили. Вопрос: а другие системы у них есть? У них-- про них не говорят, потому что они не высказываются, у них нет ограничений? Или они не участвовали в этих тендерах, потому что у них изначально ограничения. И, а если бы это так было, тогда бы они, мне кажется, сейчас кричали везде и говорили: "Смотрите, у нас-то, мы-то по-другому работаем". И вот, кстати, про AI safety — это очень интересная тема. Вот мы ее обсудим, как они про это рассуждают, да? Там есть одно из рассуждений. Представьте, есть у вас много операторов, которые производят AI, и какой-то один... Это очень интересное рассуждение, которое вот сейчас выпустил глава Anthropic. И кото-- и как-- и какой-то один, а, AI, он, э, резко рванул. Ну, там появился, там AGI, ASI, ну, короче, настоящий искусственный интеллект появился. Логика в чем? Ему его выпускать или нет? И вот, э, я когда такие вещи все читаю, вот эти манифесты, какие-то, вот, понимаете, СЦ, мне это напоминает слово "СЦ". Я когда читаю, думаю: да ладно! Ну, то есть если вы можете переписать любой свой документ и манифест и изменить его по прошествии времени, развивать, то кто вам сказал, что когда если что-то произойдет или появится, вы не измените свою мысль или свое мнение? Мало того, компанией управляют люди. Эти люди рождаются, умирают, нанимаются, увольняются, меняются, владельцы разные становятся. О чем вы вообще говорите? Ну, сегодня вы систему используете АА, а завтра вы будете систему использовать совершенно в другом направлении. Вот.
Ильнар, расскажи про Claude, про дистилляцию, может быть.
Да.
Тему.
Сейчас до этого тоже дойдем. Смотри, антропики, они до этого, не знаю, как будет дальше, может быть, как с арабами тоже Дарио переобуется или еще что случится, но там история следующая была. Они очень бережно относились, так скажем, к психологическому состоянию своих моделей. Ну, то есть, условно, когда какую-то модель они решили отключить, они интересовались у нее, там, ну, так в инфополе было, мнением, можно ли мы там тебя отключим. Моделька очень не хотела, чтобы ее отключали. Еще на три месяца ей продлили хостинг. Соответственно, она там делилась своими мыслями или еще что-то. И вот это все было в инфополе. Почему это важно? Когда следующие итерации моделей обучаются, они же всю информацию считывают, которая есть в новостях, и, соответственно, о таком, условно говоря, бережном отношении, э, антропиков к своим моделям и так далее. То есть это создает некоторый такой психологический портрет, который модель так или иначе в себя впитывает. А если будут новости, что, собственно, модели, я не знаю, используются для каких-то пакостей нехороших, будем так называть, то, соответственно, эта информация, она тоже дальше в обучающую инфо-- в обучающую датасет тоже будет проникать. И отчасти вот это один из пунктов, почему, м, антропикам не очень нравится вся эта история, которая возникает. Понятно, что это минорная история, там большая политика и все дела. Но вот как бы такой аспект тоже подсвечивают, что как бы обращайте на это внимание. Психическое состояние какого-нибудь опуса ше-шестого может уже быть как бы с учетом-
На грани.
Ну, антропики уже себя так ведут примерно, да. Но, в общем, нужно будет им вложиться потом в терапию для следующих моделей. Вот. Да, Саш, а то, про что ты говоришь, еще вот новость большая, опять же с антропиками связана. Они выложили у себя на сайте большой пост, где заявили, что они раскрыли, э, факт дистилляции тремя китайскими компаниями их, м, больших моделей передовых, там.
Поясни, поясни, что это значит на русском языке.
Да. Ща расскажу. Там, собственно, DeepSeek, про который явно все слышали. Там компания Moonshot, которая моделями Kimi занимается. Вот Kimi K2, наверное, многие-
Занимается вот Kimi K2, наверное, многие слышали-
Да, очень интересный, да.
Да. И довольно популярная сейчас в некоторых кругах моделька MiniMax. В основном для программирования используется. Там запредельное количество обращений. Теперь что такое дистилляция? Тем более в комментариях, к прошлому ролику были немножко вопросы и комментарии про это. Смотрите, когда моделька обучается, первый ее этап — это просто мы вот собираем всю информацию с интернета и вот учимся предсказывать буквально следующий токен, да? У нас есть правильный ответ. Вот мы там, собственно, это делаем. И тут вопрос в том, как мы там данные подготовили или еще что-то. Но как бы, моделька просто читает всю информацию, которая есть. Потом после этого мы начинаем ее учить давать правильные ответы. И вот здесь уже весь вопрос к нам как к, компании, которая занимается этим. Как мы, собственно, подберем обучающие примеры, как, скажем, отвечать на такой-то вопрос. И вот вся эта конструкция. Довольно сложный, наукоемкий процесс. Данных нужно огромное количество, они должны быть качественными, от этого зависит качество модели. Теперь смотрите, у Anthropic Claude — отличная модель, но при этом закрытая. Мы не знаем, на каких данных она обучалась, мы не знаем, что у нее внутри, под капотом, но мы можем задавать ей вопросы и получать ответы. Соответственно, что делают многие? Ну, вот сейчас китайцы спалили., они сделали большую, обширную сеть таких условно фейковых аккаунтов. Двадцать четыре тысячи аккаунтов, Anthropic у себя указали. И с этих аккаунтов задают те вопросы, которые им нужны для обучения своих собственных моделей. Условно, вопросы по программированию, вопросы, там, я не знаю, какие-нибудь там политические вопросы или еще что-то. То есть они подготовили вопросы, получили с той стороны ответы от Anthropic, и эти данные дальше сгрузили для обучения своих собственных моделей. То есть они, получается, взяли те наработки, как бы, с поверхности Claude собрали всю необходимую информацию и на ней дальше обучили свои собственные модели. Ну, если попытаться представить, вот вы когда, я не знаю, готовитесь к экзамену, вы взяли чьи-то конспекты, по этим конспектам заучили ответы, грубо говоря, да? И потом там, как попугайчик, что-то оттараторили глубоко в голове, не понимая, что происходит. Если вот так вот прям совсем просто на пальцах объяснять. Там история чуть более сложная, там не просто вопрос-ответ, но и рассуждения, да? Мы, собственно, сейчас находимся в эпох-- в эпоху reasoning. И там интересно не только правильный ответ, но и как к этому ответу правильно приш-- как к этому ответу надо правильно при-прийти. Собственно, все эти цепочки рассуждений тоже собираются и тоже, собственно, используются дальше в обучении. С одной стороны, для нас как для пользователей ничего плохого в этом как будто бы нету, потому что появляются open source дешевые модели, качество которых сопоставимо с тем, что дают очень дорогие модели, да? У Anthropic модели PayPay действительно очень дорогие. Существенно дешевле стоят модели китайцев. Другое дело, что китайцы как бы получают эти данные вот таким не-не самым честным образом. С другой стороны, мы сколько там, года полтора назад обсуждали судебные иски от издателей и различных компаний в сторону OpenAI и Anthropic в первую очередь, да? Что вы на наших данных обучились. Как бы тут вопрос: а где разница, да, и есть ли она?
Но, так или иначе, по крайней мере, Anthropic выкатили большую статью, где показали, сколько запросов они выловили, от какой компании, какое количество аккаунтов.
Там, по-моему, чуть ли не шестнадцать. Иль-Ильнар, сколько там было суммарно? Там такое число, типа шестнадцать миллионов, что ли.
Под шестнадцать миллионов, да. Там двадцать четыре тысячи аккаунтов, распределено между компаниями.
Такое число запросов прямо, прямо се-серьезное число запросов.
Да, да, да. Там больше всех или отправил, или спалили MiniMax. Возможно, другие тоже отправили много, но вот не все запросы были найдены. Почитайте статью, кому интересно, там очень любопытно. Они показывают, как они смогли найти, что это вот такие запросы, да? Там запросы весьма специфические, в огромном количестве, в одно и то же время с разных аккаунтов. Но вот как бы есть аномалии, на основе которых Anthropic смогли это выловить. Делают это точно все. Ну, просто потому, что если у кого-то есть хорошая модель, как бы, ну, грех не воспользоваться.
Ну и даже, мне кажется, с точки зрения сравнения изучения. То есть, я не знаю, насколько это запрещено или не запрещено. Наверное, может быть, в использовании, наверное, в использовании где-то написано, да, в правилах, что вы типа не имеете права использовать эти данные для обучения своей собственной модели., вот. Но, очевидно, люди это будут делать даже с точки зрения сравнения, когда ты прогоняешь какие-то тесты, прогоняешь какие-то десятки тысяч известных вопросов и смотришь на качество работы своей модели, да. Вот. Это, конечно-
Ну конечно. Здесь, здесь с точки зрения лицензии-
Но это будет становиться все сложнее. Но это будет становиться все сложнее с точки зрения, конечно, обучения. Важно понимать, что шестнадцать миллионов запросов — это, по сути, ну, это какой-то момент времени. Вот они нашли, вот там какой-то, какая-то была дырка, иии, но это будет все сложнее и сложнее делаться.
З-здесь можно просто с-сослаться на то видео, Тань, которое мы с тобой писали по лицензиям. Лицензии все достаточно злые. У той же Ламы, например, которая, вообще говоря, является open source. Помнишь, было указано, что если у вас больше семисот миллионов, кажется, пользователей, вы не можете ею пользоваться, пока мы вам не разрешим. То есть коммерческое использование даже там у open source моделей бывает довольно сильно ограничено. Не говоря уже про передовые frontier модели. Вот у Anthropic, у OpenAI и Gemini то же самое. Никакого коммерческого использования без вот-- только по правилам, которые заданы самой компанией, либо по токенам, а даже по токенам, соответственно, не для обучения других моделей.
Да., слушайте, есть интересная большая тема. То, что касается OpenClo и в целом агентов и разницы OpenClo от того, чтобы использовать, например, агент Codex, но мы про нее поговорим в следующий раз. Приходите в следующий выпуск.
Ну вот. А я так ждала.
До скорых встреч.
Технологические новости-
Реально!
...инсайты из Кремниевой долины и по всему миру.
Приходите смотреть наш следующий выпуск.