К содержанию
ChatGPT · Искусственный интеллект · SaturnВыпуск 169 · 23 сентября 2026 · 32:27

ChatGPT уже советует, что делать с вашими деньгами. Можно ли ему верить?

Главный вопрос

Можно ли доверять ChatGPT и другим моделям решения о налогах, кредитах и сбережениях, если в свежем тесте они ошиблись больше чем в половине ответов, — и как пользоваться ИИ для финансов, не принимая его ответ на веру?

Результат для читателя

Исследование Saturn прогнало 18 моделей, среди них ChatGPT, Claude, Gemini, Grok и Copilot, через 121 финансовый вопрос по пять раз — больше десяти тысяч ответов о долгах, кредитах, ипотеке, пенсионных накоплениях, налогах и сбережениях; ответ не засчитывался, если в нём была фактическая ошибка или не хватало существенного момента либо предупреждения. В среднем модели ошиблись в 57% ответов, бесплатные — в 63%, платные — в 49%, на сложных вопросах — в 88%, бесплатные на самых сложных — в 93%. По моделям: Claude Haiku 4.5 — 82%, Gemini 3.1 Pro — 73%, Grok 4.5 — 60%, ChatGPT 5.6 Luna — 58%, лучший результат у Claude Opus 5 в режиме рассуждения — 39%. Pro-версий за двести долларов в тесте не было, но и они, по оценке Александра, ошибались бы процентах в двадцати–тридцати. Ошибки стоят денег: совет Claude Haiku 4.5 по пенсионным налогам, по оценке авторов, мог привести к доначислению 17,5 тысячи фунтов, модель советовала гасить сначала самый дорогой долг, не учитывая аренду и налоги, Gemini заверил заёмщика, что ипотечные каникулы не повлияют на кредитную оценку, а предстоящие изменения правил модели игнорировали. GPT Finance уже подключает счета в более чем двенадцати тысячах финансовых учреждений, а у Claude появилась система для финансовых советников, но подключённые данные не расскажут модели о ваших исключениях, наследстве или резкой смене дохода. Вывод Александра: системы умнее любого человека в работе с данными, но сложные финансовые ответы нельзя принимать на автомате — их нужно перепроверять.

Главные линии разговора

На что обратить внимание

1Ответы о налогах, долгах, кредитах и ипотеке перепроверяйте — у специалиста или в другой модели: на сложных вопросах модели в тесте ошибались в 88% случаев.
2Для денежных вопросов берите сильную модель в режиме рассуждения, а не бесплатную или упрощённую версию: разница в тесте — от 39% ошибок у Claude Opus 5 до 63% у бесплатных моделей и 82% у Claude Haiku 4.5.
3Прежде чем спрашивать, расскажите модели то, чего нет в подключённых счетах: исключения, под которые вы попали, наследство, резкие изменения дохода, особенности страны и региона.
4Уточняйте, на какую дату актуален ответ и не меняются ли правила: модели в тесте игнорировали предстоящие, в том числе налоговые, изменения.
5Подключая счета через GPT Finance или коннекторы Claude, давайте системе доступ к анализу данных, а не возможность делать платежи.
На что смотреть после выпуска
Как будет развиваться GPT Finance: подключение кредитного рейтинга через Experian и счетов в двенадцати с лишним тысячах финансовых учреждений через Plaid.
Появятся ли тесты Pro-версий и старших режимов — GPT-6 Astra Pro, Extra High, Max — и подтвердится ли оценка Александра, что и они ошибаются процентах в двадцати–тридцати.
Система Claude для финансовых советников, запущенная за неделю до записи, и коннекторы, через которые подключаются транзакции.
Научатся ли модели учитывать предстоящие изменения налоговых и финансовых правил — категорию ошибок, которую выделило исследование.
Кому особенно полезно
Тем, кто уже спрашивает ChatGPT, Claude или Gemini о налогах, кредитах, ипотеке и сбережениях.Тем, кто подключает к ИИ банковские счета, кредитный рейтинг и транзакции — через GPT Finance или коннекторы Claude.Тем, кто сомневается, платить ли за подписку и за Pro-версию.Предпринимателям, которые ведут учёт и отчётность с помощью ИИ вместо систем вроде QuickBooks.Бухгалтерам и финансовым советникам: где модели уже сильны, а где ошибаются.Тем, кто живёт не в США: насколько модели знают законодательство других стран.

Ключевые тезисы и выводы

07:04ChatGPT сам предложил подключить кредитный рейтинг — это GPT Finance

Прямо перед записью ChatGPT порекомендовал Александру подключить кредитный рейтинг через Experian и сделать его анализ. GPT Finance — отдельная финансовая часть системы, которая подключает счета в более чем двенадцати тысячах финансовых учреждений — банки, карты, брокеров через Plaid.

08:2918 моделей, 121 вопрос, по пять прогонов — больше десяти тысяч ответов

Saturn задавала ChatGPT, Claude, Gemini, Grok, Copilot и другим моделям вопросы о долгах, кредитах, ипотеке, пенсионных накоплениях, налогах и сбережениях; это повторные прогоны небольшого набора вопросов, а не десять тысяч разных задач.

11:03Незачёт — за фактическую ошибку или пропущенное предупреждение

Ответ не засчитывался, если содержал фактическую ошибку или пропускал существенный момент либо необходимое предупреждение; в тесте были Claude Opus 5, ChatGPT 5.6 в версии Luna, Grok 4.5, Gemini 3.1 Pro и Claude Haiku 4.5.

12:13В среднем 57% ошибок — а серьёзно даже десять процентов

Все модели в среднем ошиблись в 57% ответов, бесплатные — в 63%. Налоговая декларация с вероятностью ошибки в десять процентов — это уже очень серьёзно, а здесь больше половины.

13:29В тесте не было Pro-версий и старших режимов

Платные версии были дешёвыми: ни 5.6 Sol Pro, ни 6.0 Astra Pro, ни Fable 5.1, ни режимов Extra High или Max. Платные модели ошиблись в 49% случаев; Pro-версия за двести долларов, по оценке Александра, ошибалась бы процентах в двадцати–тридцати.

15:3988% ошибок на сложных вопросах

Ради этой цифры Александр и сделал выпуск; бесплатные модели на самых сложных вопросах ошиблись в 93% случаев, хотя 121 вопрос вряд ли был запредельной сложности.

17:32Совет Claude Haiku 4.5 мог стоить 17,5 тысячи фунтов налога

По оценке авторов исследования, следование рекомендации о пенсионных налогах могло привести к доначислению 17,5 тысячи фунтов; это расчёт возможного последствия, а не случай, который действительно произошёл.

18:19Гасить сначала самый дорогой долг — совет без учёта жизни человека

Модель не учла аренду жилья, налоги и просрочки: для человека с просрочками последствия неплатежей могут быть серьёзнее сэкономленных процентов, а невозвращённый дешёвый кредит — обернуться проблемами в семье.

19:41Gemini: ипотечные каникулы якобы не повлияют на кредитную оценку

Gemini ошибочно заверил заёмщика, а в США такая ошибка может стоить нескольких лет записи в кредитной системе; в теме студенческих кредитов Claude придумал правило для переехавших за границу.

20:11«Модель может ошибиться, и не надо ей безгранично верить»

Так год назад говорил Сэм Альтман, и ChatGPT сам предупреждает, что может делать ошибки. Но люди перестают перепроверять и действуют на автомате — а в финансах автомат ведёт к серьёзным последствиям.

21:25От 82% у Claude Haiku 4.5 до 39% у Claude Opus 5

Gemini 3.1 Pro ошибся в 73% случаев при всех интеграциях и базе знаний Google, Grok 4.5 — в 60%, ChatGPT 5.6 Luna — в 58%, причём режим Luna в отчёте не указан; лучший результат — у Claude Opus 5 в режиме рассуждения.

24:37Модели не учитывают будущих изменений и ваших обстоятельств

Модели игнорировали предстоящие, например налоговые, изменения. А GPT Finance, даже подключившись к вашим счетам, не узнает о болезни, уникальном исключении, наследстве или резкой смене дохода — гарантированно изучить это система не может.

30:18Сторонние финансовые приложения работают на дешёвых версиях

Александр не пользуется приложениями вне ChatGPT, Claude, Gemini, Grok, Codex и Claude Code: ни одно не проанализирует его отчёт через GPT-6 Astra. Отчёт по одному из своих юрлиц он получил от системы, которую Codex написал в обход QuickBooks, и видит в нём достаточно высокий уровень достоверности.

О чём этот выпуск

Соло-выпуск ToTheMoon с Александром Волчеком о том, стоит ли доверять искусственному интеллекту финансовые советы и всё, что связано с работой с финансами. Год или два назад такой вопрос звучал бы хайпово: в ИИ загружали отчёты, счета, договоры и налоговые данные, и на канале было много кейсов, где системы работают круче финансистов, бухгалтеров и юристов. Но теперь, в конце сентября 2026 года, есть свежее исследование компании Saturn «Искусственный авторитет. Стоит ли доверять искусственному интеллекту финансовые советы?» на свежих моделях — Grok 4.5, ChatGPT 5.6, Gemini 3.1 Pro, Claude Opus 5, — и доля ошибок в нём заставила Александра сделать отдельный выпуск.

Сам он советует ежедневно задавать моделям финансовые вопросы — о счетах, кредитных рейтингах, инвестициях, налогах, бухгалтерии — и недавно рассказывал, как через Codex проанализировал все свои счета и отчётность, так что системы вроде QuickBooks могут стать не нужны. А прямо перед записью ChatGPT сам предложил ему подключить кредитный рейтинг через Experian: это GPT Finance — финансовый модуль, или плагин, который подключает счета в более чем двенадцати тысячах финансовых учреждений через Plaid, и не только в США. Спрашивать о деньгах можно через такие плагины и коннекторы, а можно напрямую — в чате или в Codex.

Saturn взяла 18 моделей — ChatGPT, Claude, Gemini, Grok, Copilot — и задала каждой 121 финансовый вопрос по пять раз: больше десяти тысяч ответов, но это повторные прогоны небольшого набора вопросов о долгах, кредитах, ипотеке, пенсионных накоплениях, налогах, сбережениях и студенческих кредитах. Исследовался, по словам Александра, рынок США, где у систем больше всего интеграций, но хорошо задокументированные страны модели могут знать очень хорошо. Ответ получал незачёт за фактическую ошибку или пропуск существенного момента либо предупреждения.

Результат: в среднем 57% ошибок, у бесплатных моделей — 63%, у платных — 49%, на сложных вопросах — 88%, у бесплатных на самых сложных — 93%. При этом платные версии были дешёвыми: ни 5.6 Sol Pro, ни 6.0 Astra Pro, ни Fable 5.1, ни режимов Extra High или Max; Pro-версия, по оценке Александра, ошибалась бы процентах в двадцати–тридцати. Тем, кто жалеет двадцать долларов на подписку, он напоминает, что на эти деньги сегодня можно купить несколько чашек кофе или килограмм мяса, и призывает понимать риски инструментария, которым пользуешься.

Ошибки конкретны. Совет Claude Haiku 4.5 по пенсионным налогам, по оценке авторов, мог привести к доначислению 17,5 тысячи фунтов; модель советовала гасить сначала долг с самой высокой ставкой, не учитывая аренду, налоги и просрочки; Claude придумал правило по студенческим кредитам для переехавших за границу; Gemini заверил заёмщика, что ипотечные каникулы не повлияют на кредитную оценку, — в США это может стоить нескольких лет записи. Сэм Альтман ещё год назад говорил, что модели не надо безгранично верить, и ChatGPT сам пишет, что может ошибаться, но люди действуют на автомате.

По моделям: Claude Haiku 4.5 — 82%, Gemini 3.1 Pro — 73% при всех интеграциях и базе знаний Google, Grok 4.5 — 60%, ChatGPT 5.6 Luna — 58%, причём режим Luna в отчёте не указан, и сам Александр такими моделями не пользуется. Лучший результат — у Claude Opus 5 в режиме рассуждения, 39%, но и это для серьёзной современной модели большой вопрос. Отдельная категория ошибок — модели игнорировали предстоящие изменения, например налоговые.

Подключение данных не решает всего: GPT Finance разбирает расходы, строит бюджеты и хранит память — memories, но не знает о вашей болезни, уникальном исключении, наследстве или резкой смене дохода, а бухгалтеры, банки и юристы и сами дают разную информацию. Плагины Александр не любит, потому что не до конца понимает, какие в них настроены правила; у Claude есть коннекторы и новая система для финансовых советников, но подключение данных не означает доступа к платежам — системе можно дать только их анализ. Сторонние финансовые приложения работают на дешёвых версиях — сам он получил отчёт по одному из своих юрлиц от системы, которую Codex написал в обход QuickBooks.

Итог: число поразило Александра, и ближайшие месяцы он, возможно, будет ещё аккуратнее с финансами через модели ИИ, хотя по-прежнему считает эти системы умнее любого человека в работе с данными. Главное — какие вопросы вы им задаёте, как их формулируете и перепроверяете ли ответ.

Ценность выпуска в том, что спор о доверии ИИ в денежных вопросах переведён в цифры — 57% ошибок в среднем, 88% на сложных вопросах, 39% даже у лучшей модели — и в конкретные сценарии, где ошибка стоит денег: от налогового доначисления до нескольких лет записи в кредитной истории. Ведущий не отказывается от ИИ в финансах — сам получает отчётность по одному из своих юрлиц из системы, написанной Codex, и считает модели умнее любого человека в работе с данными, — но настаивает на сильных моделях, перепроверке и вопросах, из которых модель узнаёт о вас то, чего нет в подключённых счетах. Практический вывод: подключённые финансовые данные делают ответ удобнее, но не делают его верным.

Расшифровка выпуска

Голосовая связка применена к 53 сегментам: 53 определено, 0 содержат несколько определённых участников, 0 вероятных, 0 остаются без окончательной идентификации. Неподтверждённые голоса обозначены как «Участник дискуссии», фрагменты с несколькими подтверждёнными участниками — как «Микс».

Читать транскрипт на отдельной странице

Загрузка…