Свой Google по всей вашей жизни и работе – уже реально
Как собрать собственный поиск по всем своим материалам — письмам, книгам, лекциям, видео, файлам — так, чтобы он показывал не совпадения слов, а связи между людьми, местами и темами, и что это даёт в работе и в бизнесе?
Читатель поймёт, чем такой поиск отличается и от обычного, и от вопроса в чате: сущности и связи вместо ключевых слов, глубина упоминания вместо факта совпадения. Получит два разобранных кейса — библиотека из трёх с половиной тысяч лекций одного автора и поиск по выпускам ToTheMoon, — рамку по правам, где скачивать можно, а где нет, и понимание, где на таких системах зарабатывают: внутри компании, внутри профессии и как отдельный продукт.
На что обратить внимание
Ключевые тезисы и выводы
Письма, документы, фотографии, видео, заметки, проекты, заключения врачей — база данных о собственной жизни и работе у каждого огромная. Проблема не в объёме, а в том, что когда нужно найти что-то конкретное, мы часто даже не помним, где это лежит.
Искусственный интеллект можно научить не просто искать слова, а понимать, как связаны между собой люди, события, темы и документы. Из этого и складывается собственный Google по всей своей информации.
Обсуждение на TechCrunch: что будет, если человек перестанет открывать страницы. Раньше в выдаче давали короткий текст, и при плохом описании страницу приходилось открывать; сейчас поиск сам делает саммари нужных блоков — и меняется вся конструкция: информация, время, реклама.
Автору новый порядок нравится: в поисковиках накопился мусор, и вариант, где сначала работает генеративная модель, а список ссылок вторичен, ему ближе прежнего. Bing на этой неделе тоже объявил обновление поиска.
Google Gemini выделил в обновлениях отдельный блок про борьбу с галлюцинациями и технические настройки для проверки. Повод конкретный: модель способна выдать рейтинг IMDb фильма, которого не существует, и ссылку на Amazon, которую давать не имеет права.
TechCrunch закрыт для моделей: попросив разобрать его новость, вы получите ответ, что зайти туда нельзя. Автор говорит, что открывал бы большинство сайтов, но видит проблему: если материал разбирается внутри модели, читателю сам источник уже не нужен.
Знакомый автора с большой CMS-системой делает противоположное: пишет вставки, код и текст, чтобы вся его техническая документация попала в модели. Логика простая — если он внутри, его хотя бы предложат и напишут код под его систему; если нет, не предложат вовсе.
Чтобы модель нашла информацию по-настоящему, её нужно ей представить. Разница между «собрала то, что удалось скачать» и «получила структурированную информацию, где показано именно то, что вы хотите донести» — и есть ответ на вопрос, зачем свой ресурс.
У Рудольфа Штайнера около трёх с половиной тысяч лекций на немецком языке, открытых как достояние человечества: с ними можно работать, структурировать, изучать и переводить. Найти и скачать их автор попросил Codex.
Права автор проверял параллельно в ChatGPT и различает личное пользование и публикацию на своём ресурсе. Скачивание русскоязычных книг того же автора оказалось нарушением лицензии — поэтому в работу пошли немецкие лекции, которые система постепенно учится переводить.
Задача ставилась про взаимосвязи сущностей: люди, места, темы, события. Места бывают разного масштаба — США, Калифорния, Кремниевая долина, Apple Park как локация компании; люди — это и имя, и роль: ребёнок, жена, отец, друг.
На ToTheMoon это уже частично работает: введя локацию, видно, в скольких выпусках она была центральной, а в скольких осталась микроупоминанием. Микроупоминание — это обычный поиск; ценность даёт структурирование.
В Codex, Claude Code и даже в ChatGPT загружаются лекции, конспекты, фотографии, поездки, почта из Gmail или Google Docs — и структурируются по семантике, топологии, сущностям и вхождениям. Сверхфундаментального понимания это не требует: вопрос в том, насколько внятно поставлена задача.
Для маркетологов, продажников, проектных и продуктовых руководителей это прямо относится к работе, и такие ресурсы поднимаются внутри компаний почти в любой нише. Двадцать лет назад так же появлялись агрегаторы — Airbnb, Booking, Skyscanner, Kayak, — потом мир застыл, а сейчас порог снова низкий.
О чём этот выпуск
Соло-выпуск Александра Волчека о собственном поиске по собственным материалам. Отправная точка бытовая: у каждого есть большая база данных о своей жизни и работе — письма, документы, фотографии, видео, заметки, проекты, заключения врачей, — и когда нужно найти что-то конкретное, мы часто даже не помним, где это лежит.
Первый блок — что происходит с поиском вообще. Проектов, где делают собственные поисковики, становится больше, в том числе у выходцев из крупных поисковых компаний. Свежий повод для разговора — обсуждение на TechCrunch о том, что будет, если человек перестанет заходить на сайты: автор говорит, что по себе видит именно это, потому что модель сама делает саммари нужных блоков. Меняется вся конструкция — получение информации, распределение времени, реклама. Автору такой порядок нравится больше прежнего, хотя качество ещё догоняет: Google Gemini выделил в обновлениях отдельный блок про борьбу с галлюцинациями, а модель до сих пор способна выдать рейтинг IMDb несуществующего фильма.
Отсюда развилка для владельца сайта: открывать его моделям или закрываться. TechCrunch закрыт, и автор понимает почему — если материал разбирается внутри модели, читателю сам источник уже не нужен. Одна логика ведёт к revenue share, обратная — к знакомому автора с большой CMS-системой, который максимально кормит модели, чтобы его хотя бы предлагали.
Второй блок — два своих проекта. Первый: около трёх с половиной тысяч лекций Рудольфа Штайнера на немецком языке, открытых как достояние человечества. Автор попросил Codex найти и скачать их, а права проверял параллельно в ChatGPT: русскоязычные книги того же автора скачивать было нельзя по лицензии, немецкие лекции — можно, и дальше система учится их переводить. Второй: поиск по выпускам ToTheMoon, который частично уже работает на сайте, — там видно, в скольких выпусках тема была центральной, а в скольких осталась микроупоминанием.
Третий блок — как это делается и где здесь деньги. Задача ставится не про поиск, а про сущности и связи между ними: люди, места разного масштаба, темы, события, роли. Сегодня в Codex, Claude Code и даже в ChatGPT можно загрузить лекции, конспекты, фотографии, поездки, импортировать почту и структурировать всё это по семантике, топологии и вхождениям — без сверхфундаментального понимания, вопрос лишь в том, насколько внятно поставлена задача. Отдельная рамка — лицензии: из сети X скачивать нельзя, за это большие штрафы, остаётся API. Заканчивается выпуск бизнес-стороной: такие ресурсы поднимаются внутри компаний почти в любой нише, как двадцать лет назад поднимались агрегаторы вроде Airbnb и Booking.
Выпуск про то, что личный поиск перестал быть инженерной задачей и стал редакторской. Технически всё сводится к тому, чтобы внятно поставить задачу Codex или Claude Code; трудное начинается раньше — решить, какие сущности вы выделяете, что считаете настоящей связью, а что микроупоминанием, и на каких правах вообще берёте материал. Автор честно проговаривает обе границы: лицензию, которая заставила его отказаться от русскоязычных книг в пользу немецких лекций, и запрет на выкачивание из сети X. Ценность здесь не в объёме загруженного, а в структуре: обычный поиск по словам у читателя и так есть.
Расшифровка выпуска
Голосовая связка применена к 33 сегментам: 33 определено, 0 содержат несколько определённых участников, 0 вероятных, 0 остаются без окончательной идентификации. Неподтверждённые голоса обозначены как «Участник дискуссии», фрагменты с несколькими подтверждёнными участниками — как «Микс».
Загрузка…