ChatGPT уже советует, что делать с вашими деньгами. Можно ли ему верить?
Можно ли доверять ChatGPT и другим моделям решения о налогах, кредитах и сбережениях, если в свежем тесте они ошиблись больше чем в половине ответов, — и как пользоваться ИИ для финансов, не принимая его ответ на веру?
Исследование Saturn прогнало 18 моделей, среди них ChatGPT, Claude, Gemini, Grok и Copilot, через 121 финансовый вопрос по пять раз — больше десяти тысяч ответов о долгах, кредитах, ипотеке, пенсионных накоплениях, налогах и сбережениях; ответ не засчитывался, если в нём была фактическая ошибка или не хватало существенного момента либо предупреждения. В среднем модели ошиблись в 57% ответов, бесплатные — в 63%, платные — в 49%, на сложных вопросах — в 88%, бесплатные на самых сложных — в 93%. По моделям: Claude Haiku 4.5 — 82%, Gemini 3.1 Pro — 73%, Grok 4.5 — 60%, ChatGPT 5.6 Luna — 58%, лучший результат у Claude Opus 5 в режиме рассуждения — 39%. Pro-версий за двести долларов в тесте не было, но и они, по оценке Александра, ошибались бы процентах в двадцати–тридцати. Ошибки стоят денег: совет Claude Haiku 4.5 по пенсионным налогам, по оценке авторов, мог привести к доначислению 17,5 тысячи фунтов, модель советовала гасить сначала самый дорогой долг, не учитывая аренду и налоги, Gemini заверил заёмщика, что ипотечные каникулы не повлияют на кредитную оценку, а предстоящие изменения правил модели игнорировали. GPT Finance уже подключает счета в более чем двенадцати тысячах финансовых учреждений, а у Claude появилась система для финансовых советников, но подключённые данные не расскажут модели о ваших исключениях, наследстве или резкой смене дохода. Вывод Александра: системы умнее любого человека в работе с данными, но сложные финансовые ответы нельзя принимать на автомате — их нужно перепроверять.
На что обратить внимание
Ключевые тезисы и выводы
Прямо перед записью ChatGPT порекомендовал Александру подключить кредитный рейтинг через Experian и сделать его анализ. GPT Finance — отдельная финансовая часть системы, которая подключает счета в более чем двенадцати тысячах финансовых учреждений — банки, карты, брокеров через Plaid.
Saturn задавала ChatGPT, Claude, Gemini, Grok, Copilot и другим моделям вопросы о долгах, кредитах, ипотеке, пенсионных накоплениях, налогах и сбережениях; это повторные прогоны небольшого набора вопросов, а не десять тысяч разных задач.
Ответ не засчитывался, если содержал фактическую ошибку или пропускал существенный момент либо необходимое предупреждение; в тесте были Claude Opus 5, ChatGPT 5.6 в версии Luna, Grok 4.5, Gemini 3.1 Pro и Claude Haiku 4.5.
Все модели в среднем ошиблись в 57% ответов, бесплатные — в 63%. Налоговая декларация с вероятностью ошибки в десять процентов — это уже очень серьёзно, а здесь больше половины.
Платные версии были дешёвыми: ни 5.6 Sol Pro, ни 6.0 Astra Pro, ни Fable 5.1, ни режимов Extra High или Max. Платные модели ошиблись в 49% случаев; Pro-версия за двести долларов, по оценке Александра, ошибалась бы процентах в двадцати–тридцати.
Ради этой цифры Александр и сделал выпуск; бесплатные модели на самых сложных вопросах ошиблись в 93% случаев, хотя 121 вопрос вряд ли был запредельной сложности.
По оценке авторов исследования, следование рекомендации о пенсионных налогах могло привести к доначислению 17,5 тысячи фунтов; это расчёт возможного последствия, а не случай, который действительно произошёл.
Модель не учла аренду жилья, налоги и просрочки: для человека с просрочками последствия неплатежей могут быть серьёзнее сэкономленных процентов, а невозвращённый дешёвый кредит — обернуться проблемами в семье.
Gemini ошибочно заверил заёмщика, а в США такая ошибка может стоить нескольких лет записи в кредитной системе; в теме студенческих кредитов Claude придумал правило для переехавших за границу.
Так год назад говорил Сэм Альтман, и ChatGPT сам предупреждает, что может делать ошибки. Но люди перестают перепроверять и действуют на автомате — а в финансах автомат ведёт к серьёзным последствиям.
Gemini 3.1 Pro ошибся в 73% случаев при всех интеграциях и базе знаний Google, Grok 4.5 — в 60%, ChatGPT 5.6 Luna — в 58%, причём режим Luna в отчёте не указан; лучший результат — у Claude Opus 5 в режиме рассуждения.
Модели игнорировали предстоящие, например налоговые, изменения. А GPT Finance, даже подключившись к вашим счетам, не узнает о болезни, уникальном исключении, наследстве или резкой смене дохода — гарантированно изучить это система не может.
Александр не пользуется приложениями вне ChatGPT, Claude, Gemini, Grok, Codex и Claude Code: ни одно не проанализирует его отчёт через GPT-6 Astra. Отчёт по одному из своих юрлиц он получил от системы, которую Codex написал в обход QuickBooks, и видит в нём достаточно высокий уровень достоверности.
О чём этот выпуск
Соло-выпуск ToTheMoon с Александром Волчеком о том, стоит ли доверять искусственному интеллекту финансовые советы и всё, что связано с работой с финансами. Год или два назад такой вопрос звучал бы хайпово: в ИИ загружали отчёты, счета, договоры и налоговые данные, и на канале было много кейсов, где системы работают круче финансистов, бухгалтеров и юристов. Но теперь, в конце сентября 2026 года, есть свежее исследование компании Saturn «Искусственный авторитет. Стоит ли доверять искусственному интеллекту финансовые советы?» на свежих моделях — Grok 4.5, ChatGPT 5.6, Gemini 3.1 Pro, Claude Opus 5, — и доля ошибок в нём заставила Александра сделать отдельный выпуск.
Сам он советует ежедневно задавать моделям финансовые вопросы — о счетах, кредитных рейтингах, инвестициях, налогах, бухгалтерии — и недавно рассказывал, как через Codex проанализировал все свои счета и отчётность, так что системы вроде QuickBooks могут стать не нужны. А прямо перед записью ChatGPT сам предложил ему подключить кредитный рейтинг через Experian: это GPT Finance — финансовый модуль, или плагин, который подключает счета в более чем двенадцати тысячах финансовых учреждений через Plaid, и не только в США. Спрашивать о деньгах можно через такие плагины и коннекторы, а можно напрямую — в чате или в Codex.
Saturn взяла 18 моделей — ChatGPT, Claude, Gemini, Grok, Copilot — и задала каждой 121 финансовый вопрос по пять раз: больше десяти тысяч ответов, но это повторные прогоны небольшого набора вопросов о долгах, кредитах, ипотеке, пенсионных накоплениях, налогах, сбережениях и студенческих кредитах. Исследовался, по словам Александра, рынок США, где у систем больше всего интеграций, но хорошо задокументированные страны модели могут знать очень хорошо. Ответ получал незачёт за фактическую ошибку или пропуск существенного момента либо предупреждения.
Результат: в среднем 57% ошибок, у бесплатных моделей — 63%, у платных — 49%, на сложных вопросах — 88%, у бесплатных на самых сложных — 93%. При этом платные версии были дешёвыми: ни 5.6 Sol Pro, ни 6.0 Astra Pro, ни Fable 5.1, ни режимов Extra High или Max; Pro-версия, по оценке Александра, ошибалась бы процентах в двадцати–тридцати. Тем, кто жалеет двадцать долларов на подписку, он напоминает, что на эти деньги сегодня можно купить несколько чашек кофе или килограмм мяса, и призывает понимать риски инструментария, которым пользуешься.
Ошибки конкретны. Совет Claude Haiku 4.5 по пенсионным налогам, по оценке авторов, мог привести к доначислению 17,5 тысячи фунтов; модель советовала гасить сначала долг с самой высокой ставкой, не учитывая аренду, налоги и просрочки; Claude придумал правило по студенческим кредитам для переехавших за границу; Gemini заверил заёмщика, что ипотечные каникулы не повлияют на кредитную оценку, — в США это может стоить нескольких лет записи. Сэм Альтман ещё год назад говорил, что модели не надо безгранично верить, и ChatGPT сам пишет, что может ошибаться, но люди действуют на автомате.
По моделям: Claude Haiku 4.5 — 82%, Gemini 3.1 Pro — 73% при всех интеграциях и базе знаний Google, Grok 4.5 — 60%, ChatGPT 5.6 Luna — 58%, причём режим Luna в отчёте не указан, и сам Александр такими моделями не пользуется. Лучший результат — у Claude Opus 5 в режиме рассуждения, 39%, но и это для серьёзной современной модели большой вопрос. Отдельная категория ошибок — модели игнорировали предстоящие изменения, например налоговые.
Подключение данных не решает всего: GPT Finance разбирает расходы, строит бюджеты и хранит память — memories, но не знает о вашей болезни, уникальном исключении, наследстве или резкой смене дохода, а бухгалтеры, банки и юристы и сами дают разную информацию. Плагины Александр не любит, потому что не до конца понимает, какие в них настроены правила; у Claude есть коннекторы и новая система для финансовых советников, но подключение данных не означает доступа к платежам — системе можно дать только их анализ. Сторонние финансовые приложения работают на дешёвых версиях — сам он получил отчёт по одному из своих юрлиц от системы, которую Codex написал в обход QuickBooks.
Итог: число поразило Александра, и ближайшие месяцы он, возможно, будет ещё аккуратнее с финансами через модели ИИ, хотя по-прежнему считает эти системы умнее любого человека в работе с данными. Главное — какие вопросы вы им задаёте, как их формулируете и перепроверяете ли ответ.
Ценность выпуска в том, что спор о доверии ИИ в денежных вопросах переведён в цифры — 57% ошибок в среднем, 88% на сложных вопросах, 39% даже у лучшей модели — и в конкретные сценарии, где ошибка стоит денег: от налогового доначисления до нескольких лет записи в кредитной истории. Ведущий не отказывается от ИИ в финансах — сам получает отчётность по одному из своих юрлиц из системы, написанной Codex, и считает модели умнее любого человека в работе с данными, — но настаивает на сильных моделях, перепроверке и вопросах, из которых модель узнаёт о вас то, чего нет в подключённых счетах. Практический вывод: подключённые финансовые данные делают ответ удобнее, но не делают его верным.
Расшифровка выпуска
Голосовая связка применена к 53 сегментам: 53 определено, 0 содержат несколько определённых участников, 0 вероятных, 0 остаются без окончательной идентификации. Неподтверждённые голоса обозначены как «Участник дискуссии», фрагменты с несколькими подтверждёнными участниками — как «Микс».
Читать транскрипт на отдельной странице
Загрузка…