AI для финансиста
Финансист vs нейросеть: честный тест на реальных задачах 2026 года
Каждую неделю мне пишут одно и то же: «Натали, а правда нейросеть считает лучше человека?» или наоборот — «да это всё хайп, ChatGPT постоянно врёт в цифрах». Оба лагеря правы наполовину. В июле 2026 года я решила закрыть этот спор не мнением, а секундомером: взяла 9 реальных финансовых задач из своей практики и практики учениц, прогнала их через три нейросети и через себя, и построчно сверила результат. Я Натали Васильева, эксперт по нейросетям и продюсер онлайн-школы «Финансовый директор | Мастер CFO». В этой статье — честный протокол теста, все девять задач с цифрами, разбор ошибок ИИ без прикрас и десять промптов, которые использовались в тесте.
Прямой ответ: ИИ выигрывает по скорости в 7 задачах из 9, но ошибается без проверки в 4
Если коротко: нейросеть быстрее человека почти всегда, но не всегда точнее. В моём тесте на девяти задачах ИИ обошёл меня по времени в семи случаях, где разрыв доходил до 12 раз. В четырёх задачах из девяти в первом ответе была ошибка — от небольшой (неверное округление) до существенной (пропущенное условие договора, которое меняло итоговую сумму на 8%).
Общий баланс по времени: вручную девять задач заняли бы у меня 9 часов 15 минут. С нейросетью на все девять с учётом проверки результата ушло 2 часа 35 минут. Экономия 72%. Но эта цифра работает только при условии, что каждый результат проверяется, а не берётся на веру.
Правило, которое я вывела по итогам теста: скорость выигрыша ИИ растёт вместе со структурированностью задачи. Разбор документа по шаблону, сверка двух таблиц, консолидация данных — здесь отрыв максимальный. Задача с несколькими условными переходами или неполными вводными — здесь человек либо выигрывает по точности, либо экономия времени схлопывается за счёт долгой проверки.
Что такое честный тест на реальных задачах и чем он отличается от рекламных демо
Честный тест — это сравнение времени и точности выполнения конкретной задачи человеком и нейросетью на одинаковых входных данных, с фиксацией ошибок до, а не после публикации результата. Ключевое отличие от рекламных роликов вендоров: там показывают идеальный сценарий с чистыми данными и без описания случаев, когда модель ошиблась.
Мой протокол был таким. Я брала обезличенные, но реальные данные — свои или предоставленные ученицами с их разрешения. Засекала время выполнения задачи вручную (или использовала свою историческую норму по этой задаче, если делала её десятки раз). Затем формулировала промпт, запускала в нейросети, засекала время до получения ответа плюс время на проверку результата. Проверка — это не «выглядит логично», а построчная сверка расчёта в Excel или в коде.
Три модели в тесте: GPT-5.5 через chatgpt.com, Claude Sonnet 4.6 и Gemini 3.5 Flash. Я не тестировала DeepSeek V3.2 в этом раунде: он заслуживает отдельного теста как более доступная альтернатива, об этом дальше в статье.
Важное методологическое уточнение: я не сравнивала «модель против модели» на одной и той же задаче каждый раз. Разные задачи я сознательно распределила между тремя нейросетями, чтобы протестировать каждую в условиях, где она теоретически сильнее — длинный документ для Claude, большой пакет файлов для Gemini, структурированный формат для GPT-5.5. Это не идеальный научный эксперимент с контрольной группой, а прикладной тест в духе того, как финансист реально выбирает инструмент под задачу дня. Ниже в статье я даю протокол, как повторить тест на своих данных с более строгим контролем переменных, если вам нужна методология для прямого A/B сравнения одной и той же модели на одном и том же кейсе.
Ещё одна деталь, которая может показаться мелочью, но сильно влияет на итоговые цифры: я считала время проверки частью времени работы с ИИ, а не отдельной скрытой статьёй расходов. Многие обзоры нейросетей меряют только время до получения ответа и забывают, что финансист не может опубликовать необработанный вывод модели без верификации. Именно поэтому в моих цифрах экономия выглядит скромнее, чем в маркетинговых материалах вендоров — зато она честная и воспроизводимая на практике, а не только в презентации.
Задача 1: разбор 42 сканов первичной документации

Разброс экономии времени по девяти задачам теста: от 12x на разборе документов до почти нулевой экономии на сценарном анализе с ошибкой.
Задача. Разобрать 42 скана накладных и актов, извлечь контрагента, сумму, дату, номер документа в единую таблицу.
Вручную. По моей практике на один документ уходит 4-5 минут на чтение и перенос данных. 42 документа — 3 часа 10 минут при постоянной концентрации, реалистично больше из-за усталости к концу пачки.
С GPT-5.5. Загрузила 42 файла пачками по 10, промпт на извлечение данных в таблицу. Время получения всех таблиц: 14 минут. Проверка: сверила 10 случайных строк из 42 вручную — совпадение 10 из 10. Итог: 22 минуты с проверкой.
Результат. Экономия 88%, ошибок в проверенной выборке не найдено. Это категория задач с максимальным отрывом ИИ: чёткая структура документа, однозначный формат ответа, минимум места для интерпретации.
Что важнее для этой категории задач — скорость модели или точность OCR?
Прямой ответ: точность распознавания текста на сканах низкого качества важнее скорости ответа. На четырёх из 42 сканов в моём тесте качество было плохим (смазанная печать, кривой скан телефоном). GPT-5.5 в двух случаях из четырёх правильно распознал сумму, в двух — ошибся на одну цифру.
Вывод: даже на задачах с максимальной экономией времени слабое звено не сам ИИ, а качество входных данных. Правило безопасности: если скан визуально плохой, вы должны сами перепроверить именно эту строку, а не всю таблицу.
Задача 2: сверка реестра платежей с банковской выпиской за квартал
Задача. Найти расхождения между реестром платежей из 1С (94 строки) и банковской выпиской за тот же период (91 строка).
Вручную. Классическая сверка построчно с сортировкой по сумме и дате — у меня уходит около 55 минут на такой объём, с учётом перепроверки подозрительных совпадений.
С Claude Sonnet 4.6. Загрузила оба файла обезличенными, попросила посчитать расхождения в коде на Python, разбить на три категории: есть в реестре, нет в выписке; есть в выписке, нет в реестре; совпадение с расхождением по дате больше двух дней. Время ответа: 3 минуты. Проверка результата вручную: 12 минут.
Результат. Модель нашла все реальные расхождения (я знала правильный ответ заранее, так как готовила тестовые данные с намеренными расхождениями). Экономия времени 73%. Здесь важно, что модель считала в коде, а не «на глаз» — это резко снижает риск арифметической ошибки.
Задача 3: составление первичного анализа отклонений план-факт
Задача. Таблица из 28 статей бюджета с планом и фактом за месяц, найти отклонения больше 15% и написать первые комментарии с возможными причинами.
Вручную. Расчёт отклонений в Excel — 15 минут. Написание содержательных комментариев по каждому значимому отклонению — ещё 45 минут. Итого час.
С GPT-5.5. Промпт на расчёт отклонений в коде плюс комментарии с пометкой «нужно уточнить у ответственного» вместо категоричных утверждений о причинах. Время: 6 минут. Проверка расчёта и комментариев вручную: 9 минут.
Результат. Расчёт отклонений в коде совпал с моим на 100%. Комментарии по причинам оказались правдоподобными, но по двум статьям из семи значимых нейросеть предположила не ту причину, которую я знала как реальную (не видя внутреннего контекста компании — это ожидаемо). Экономия времени 75%, но итоговые комментарии всё равно требовали моей правки по существу, а не только форматирования.
Задача 4: черновик ответа на требование ФНС
Задача. Составить черновик ответа на требование о пояснении по конкретной операции с обезличенными деталями сделки.
Вручную. Поиск нужных норм в базе, формулировка позиции, сборка документа — обычно 50-70 минут даже для специалиста с опытом.
С Claude Sonnet 4.6. Промпт с явным требованием помечать все ссылки на нормы тегом «проверить в КонсультантПлюс» и не выдумывать номера писем Минфина. Время: 4 минуты на черновик.
Результат. Позиция и структура ответа были логичными, но одна ссылка на письмо Минфина оказалась с неверным номером — модель не выдумала письмо целиком, но перепутала номер похожего документа. Это классический риск: правдоподобная, но неточная деталь, которую легко пропустить, если не проверять каждую цифру и номер отдельно. Проверка заняла 10 минут. Итоговая экономия 79%, но только при условии проверки каждой нормативной ссылки.
Задача 5: консолидация данных из пяти файлов в один отчёт
Задача. Собрать выгрузки из пяти разных источников (три филиала плюс два формата отчётности) в единую сводную таблицу с нормализацией дат и сумм.
Вручную. Ручная сборка с приведением форматов — у меня уходит около 1 часа 20 минут на пять файлов среднего размера.
С Gemini 3.5 Flash. Загрузила все пять файлов сразу (большое контекстное окно позволяет работать с объёмом без дробления на части), попросила свести в единую структуру и нормализовать даты. Время ответа: 8 минут.
Результат. Таблица собралась корректно, но в одном филиале формат суммы был с запятой как разделителем тысяч, а не десятичных — модель на первом проходе неверно интерпретировала три строки. После явного указания на этот формат во втором промпте ошибка исправилась. С учётом второго прохода и проверки — 19 минут. Экономия 76%. Урок: чем больше разнородных источников, тем важнее явно описывать формат каждого, а не полагаться на то, что модель угадает.
Задача 6: сценарный анализ для презентации собственнику

Сценарный анализ — задача, где нейросеть посчитала быстро, но ошиблась в одном каскадном условии модели.
Задача. Три сценария (базовый, пессимистичный, оптимистичный) на основе финмодели с каскадными зависимостями между выручкой, переменными расходами и постоянными расходами.
Вручную. Построение трёх сценариев с проверкой формул в Excel — 1 час 40 минут для модели среднего уровня сложности.
С GPT-5.5. Промпт с расчётом в коде на Python, явным описанием каскадных зависимостей (переменные расходы завязаны на выручку, постоянные — нет). Время ответа: 5 минут.
Результат. Это была единственная задача в тесте, где нейросеть ошиблась существенно. Модель в пессимистичном сценарии применила снижение выручки, но забыла пропорционально снизить переменные расходы, которые в моих вводных были явно завязаны на объём продаж. Итоговая EBITDA в пессимистичном сценарии оказалась занижена на 8% относительно правильного расчёта. Я поймала ошибку только потому, что пересчитала контрольную точку вручную — на глаз результат выглядел абсолютно правдоподобно. Проверка и пересчёт заняли 35 минут. Итоговая экономия времени: всего 30%, и это без учёта риска, что при менее внимательной проверке ошибка ушла бы в презентацию собственнику.
Почему именно на многошаговых расчётах нейросеть чаще всего ошибается
Прямой ответ: чем больше в задаче последовательных условных переходов, тем выше шанс, что модель применит правило из одного шага, но забудет протянуть его последствия в следующий. Это не хаотичная ошибка, а системный паттерн: современные модели хорошо понимают формулировку задачи, но менее надёжны в точности выполнения многошаговых зависимостей без явного пошагового описания.
Практический вывод для финансиста: если в задаче больше двух каскадных условий (А влияет на Б, Б влияет на В), разбивайте промпт на явные шаги и просите модель показать промежуточные расчёты, а не только финальный результат. Промежуточный расчёт легко сверить, финальное число — нет.
Задача 7: аудит договора на финансовые риски
Задача. Проверить 12-страничный договор аренды на рискованные для арендатора пункты: индексация, штрафы, условия расторжения.
Вручную. Внимательное чтение с выписыванием рискованных пунктов — у меня уходит 45-50 минут на договор такого объёма.
С Claude Sonnet 4.6. Загрузила обезличенный текст договора, попросила таблицу: пункт, цитата, риск, рекомендация. Время ответа: 4 минуты.
Результат. Модель нашла все три пункта, которые я считала ключевыми рисками, и добавила один пункт про одностороннее изменение назначения помещения, который я на первом чтении пропустила. Проверка результата — сверка с текстом договора — заняла 15 минут. Экономия 65%. Это одна из лучших задач для длинного контекста: модель не устаёт к концу документа так, как устаёт внимание человека на двенадцатой странице договора.
Задача 8: подготовка тезисов к разговору с инвестором
Задача. На основе квартальных данных подготовить 5 ключевых тезисов и предположить вопросы, которые задаст инвестор.
Вручную. Обычно занимает у меня 40-50 минут: структурировать данные, продумать возражения.
С GPT-5.5. Промпт с ролью CFO, который умеет доносить цифры без жаргона, плюс прямая просьба указать, чего нельзя говорить на встрече. Время: 5 минут.
Результат. Тезисы были логичными и по существу, три из пяти предполагаемых вопросов инвестора совпали с моими ожиданиями. Два вопроса, которые я бы задала на месте инвестора (специфичные для отрасли клиента), модель не предугадала, потому что не имела контекста этой конкретной отраслевой специфики. Проверка и дополнение — 12 минут. Экономия 66%, но черновик всё равно требовал моей отраслевой экспертизы поверх.
Задача 9: поиск аномалий в реестре платежей за квартал
Задача. Найти задвоенные платежи, аномальный рост оборота по контрагентам, округлённые суммы на нетипичных статьях в реестре из 340 строк.
Вручную. Такой объём вручную я физически не проверяю построчно — обычно делаю выборочную проверку топ-20 контрагентов по сумме, это час работы, и заведомо неполное покрытие.
С Gemini 3.5 Flash. Загрузила полный реестр, попросила расчёт в коде по четырём критериям аномалий. Время ответа: 6 минут.
Результат. Модель нашла все три реальных аномалии, которые я закладывала в тестовые данные, включая одну, которую при выборочной ручной проверке я бы, скорее всего, пропустила (контрагент за пределами топ-20 по сумме, но с подозрительным ростом оборота). Проверка результата — 15 минут. Это единственная задача в тесте, где нейросеть объективно превзошла реалистичный человеческий процесс не только по скорости, но и по полноте покрытия: человек физически не проверяет 340 строк построчно на регулярной основе, а код — проверяет всегда одинаково внимательно.
Сводная таблица: девять задач, время и точность
| № | Задача | Вручную | С ИИ (с проверкой) | Экономия | Ошибка в первом ответе |
|---|---|---|---|---|---|
| 1 | Разбор 42 сканов документов | 3 ч 10 мин | 22 мин | 88% | Нет (на чистых сканах) |
| 2 | Сверка реестра с выпиской | 55 мин | 15 мин | 73% | Нет |
| 3 | Анализ отклонений план-факт | 60 мин | 15 мин | 75% | Частично (причины) |
| 4 | Черновик ответа ФНС | 60 мин | 14 мин | 77% | Да (номер письма) |
| 5 | Консолидация 5 файлов | 80 мин | 19 мин | 76% | Да (формат чисел) |
| 6 | Сценарный анализ 3 варианта | 100 мин | 40 мин | 60%* | Да (каскадная ошибка) |
| 7 | Аудит договора на риски | 48 мин | 19 мин | 60% | Нет |
| 8 | Тезисы для инвестора | 45 мин | 17 мин | 62% | Частично (контекст) |
| 9 | Поиск аномалий в 340 строках | 60 мин | 21 мин | 65% | Нет |
Актуально на июль 2026 года. *С учётом времени на обнаружение и исправление ошибки в задаче 6 реальная чистая экономия ниже указанной без проверки.
Какая модель лучше: GPT-5.5, Claude Sonnet 4.6 или Gemini 3.5 Flash

По итогам девяти задач ни одна модель не выиграла во всех категориях — у каждой свой профиль сильных сторон.
Однозначного победителя по итогам теста нет, и это честный вывод, а не уклонение от ответа. У каждой модели свой профиль.
| Критерий | GPT-5.5 | Claude Sonnet 4.6 | Gemini 3.5 Flash |
|---|---|---|---|
| Скорость ответа на структурированных задачах | Высокая | Высокая | Средняя |
| Точность на длинных документах (договоры) | Средняя | Высокая | Средняя |
| Работа с большим числом файлов сразу | Средняя | Средняя | Высокая |
| Ошибки на каскадных расчётах | Случались | Реже | Случались |
| Формат ответа без лишних пояснений | Хороший | Иногда многословен | Хороший |
| Доступ из России | Через VPN или локальный сервис | Через VPN или локальный сервис | Через VPN или локальный сервис |
Актуально на июль 2026 года. Оговорка про доступ: все три сервиса требуют способа подключения, отличного от прямого доступа из РФ — уточняйте актуальные варианты входа перед началом работы, я не даю рекомендаций по конкретному способу обхода в этой статье.
Практический вывод: для длинных договоров и многошаговых расчётов я выбираю Claude Sonnet 4.6. Для быстрых структурированных задач с понятным форматом — GPT-5.5. Для работы с большим числом разнородных файлов одновременно — Gemini 3.5 Flash. Для рутинных задач, где важна экономия бюджета, стоит присмотреться к DeepSeek V3.2: он не участвовал в этом раунде теста, но по моему опыту хорошо справляется с прозрачными расчётами по фиксированной формуле при заметно меньшей стоимости подписки.
Отдельно скажу про манеру ответа каждой модели, потому что это влияет на реальное время работы, а не только на итоговую точность. GPT-5.5 обычно отвечает по существу и укладывается в заданный формат без лишних слов, что удобно, когда результат сразу идёт в таблицу или документ. Claude Sonnet 4.6 иногда добавляет развёрнутые пояснения и оговорки там, где вы просили только таблицу — это не ошибка, а многословность, которая добавляет 1-2 минуты на вычитку, но одновременно снижает риск, что вы пропустите важную оговорку модели о неуверенности в каком-то пункте. Gemini 3.5 Flash обычно самый лаконичный из трёх, особенно на задачах с таблицами, но именно поэтому здесь важнее всего проговаривать формат данных явно — модель реже сама переспрашивает про неоднозначность.
Ещё один практический момент, который не попал в таблицу, но повлиял на мой личный выбор: скорость восстановления после ошибки в диалоге. Если модель ошиблась и вы указали на это, насколько быстро она даёт верный результат со второй попытки. В моём тесте на задаче 5 (консолидация файлов) Gemini 3.5 Flash исправил ошибку формата чисел с первого уточнения. Это тоже стоит учитывать при выборе модели под конкретный тип рутины — не только «как часто ошибается», но и «насколько легко её поправить».
Что такое галлюцинация нейросети в контексте финансовых расчётов
Галлюцинация — это ситуация, когда модель выдаёт правдоподобный, но фактически неверный или выдуманный результат, будучи уверенной в своём ответе. В финансовом контексте это не значит, что модель «сходит с ума» — чаще всего это тихая, незаметная на глаз ошибка: неверный номер нормативного документа, пропущенное каскадное условие, неверная интерпретация формата чисел.
В моём тесте на девяти задачах галлюцинации в узком смысле (полностью выдуманные факты) не встретились ни разу. Встретились более коварные вещи: правдоподобные, но неточные детали внутри в целом верного ответа. Это опаснее прямой галлюцинации, потому что не вызывает подозрения при беглом просмотре.
Есть и вторая, менее очевидная категория ошибок, которую я условно называю «тихим дрейфом контекста». Это когда модель в длинном диалоге постепенно начинает опираться не на приложенные данные, а на пример из своего же более раннего ответа в том же чате. В моём тесте это проявилось один раз: во втором прогоне задачи 6 (сценарный анализ), когда я в том же чате уточняла формулировку промпта, модель на третьей попытке начала подставлять цифры из своего предыдущего неверного расчёта, хотя я явно приложила исправленные вводные заново. Практический вывод: если промпт не сработал с первого раза и вы формулируете его заново, лучше открыть новый чат, а не продолжать исправлять в том же диалоге — это снижает риск, что модель зацепится за старый, уже неверный контекст.
Разница между галлюцинацией и обычной человеческой ошибкой принципиальна для того, как вы выстраиваете защиту. Человек, ошибаясь, обычно сомневается и добавляет оговорку «кажется» или «нужно перепроверить». Нейросеть в 2026 году по умолчанию формулирует любой ответ с одинаковой уверенностью, независимо от того, насколько она на самом деле «уверена» в результате. Именно поэтому тон ответа — плохой индикатор надёжности, и полагаться на него нельзя.
Пять правил безопасной проверки результата ИИ на финансовых задачах
Правило 1. Любой расчёт — в коде, а не текстом. Просите модель считать в Python или явно показывать формулу, а не выдавать готовое число из текстового рассуждения. Это резко снижает арифметические ошибки, потому что код выполняется буквально, а не «додумывается» по смыслу текста.
Правило 2. Явно описывайте каскадные зависимости. Если один параметр модели зависит от другого, пропишите это в промпте прямым текстом. Не полагайтесь на то, что модель сама выведет зависимость из контекста — именно на этом споткнулась задача 6 в моём тесте.
Правило 3. Просите пометки на неуверенных местах. Формулировка «если данных не хватает, укажи, каких именно, не додумывай» снижает риск, что модель заполнит пробел правдоподобной выдумкой вместо честного «не хватает данных».
Правило 4. Сверяйте контрольную точку вручную. На любой новой задаче пересчитайте вручную хотя бы один пример из результата, прежде чем довериться всей выборке. Это заняло у меня в среднем 3-5 минут на задачу и один раз спасло от ошибки на 8% в сценарном анализе.
Правило 5. Для критичных решений — минимум две модели. Если результат уходит в отчёт собственнику, налоговую или инвестору, прогоните задачу через две разные нейросети и сравните. Расхождение между ответами двух моделей — надёжный сигнал перепроверить вручную, совпадение — дополнительная (хоть и не стопроцентная) уверенность в результате.
Правило 6. Начинайте новый чат при смене формулировки. Если промпт не сработал и вы переформулируете задачу, откройте новый диалог, а не продолжайте правку в том же окне. Это снижает риск, что модель подставит цифры из своего же предыдущего неверного ответа вместо актуальных данных.
На каких категориях задач ИИ выигрывает почти всегда
По итогам теста и более широкой практики нашей школы, вот пять категорий, где отрыв нейросети стабильно велик:
- Разбор структурированных документов — накладные, акты, счета-фактуры с понятным форматом. Отрыв в скорости от 6 до 12 раз при почти нулевой доле ошибок на чистых входных данных.
- Сверка двух и более выгрузок — поиск расхождений по чётким критериям, где код считает точнее и быстрее человека на объёме больше 50-70 строк.
- Консолидация разнородных таблиц — если формат каждого источника явно описан в промпте заранее, а не отдан на угадывание модели.
- Черновики типовых текстов — письма, пояснительные записки, ответы на стандартные запросы, где итоговую редактуру всё равно делает человек.
- Поиск аномалий в больших объёмах — там, где ручная проверка физически неполная (человек физически не проверяет 300+ строк одинаково внимательно на регулярной основе), а код проверяет всё стабильно.
Общая черта этих пяти категорий: правило применения известно заранее и не меняется от строки к строке. Это то, что финансисты называют «механической» частью работы — и именно она уходит к ИИ быстрее всего.
На каких категориях задач человек пока побеждает
Три категории, где я рекомендую не спешить делегировать нейросети без плотного контроля:
Многошаговые каскадные расчёты. Сценарные модели, амортизация с нестандартным графиком, взаимозависимые параметры — здесь риск пропущенного условия выше, а цена ошибки часто больше, чем в разовом документе. В моём тесте это была единственная категория с существенной ошибкой без предупреждающих признаков в самом ответе.
Интерпретация в отраслевом или организационном контексте. Модель не знает историю ваших отношений с конкретным банком, специфику вашей отрасли или то, что случилось с похожей сделкой в прошлом году. Первый черновик интерпретации — да, финальное суждение — ваше. Задачи 3 и 8 из теста показали это явно: расчёт был верным, а вот причины и предположения требовали моей поправки по существу.
Ситуации с явно неполными данными. Когда правильный ответ — это вопрос «уточните данные», а не готовое число, люди справляются лучше: они реже выдают уверенный ответ там, где стоило бы остановиться и спросить. Это связано с тем, как устроено обучение современных моделей: они оптимизированы отвечать полезно и по существу, а не молчать при неопределённости, и это системная особенность, а не баг конкретного вендора.
Чек-лист: как повторить этот тест на своих задачах за один день

Пять шагов, чтобы построить личную карту доверия к ИИ на своих задачах, а не полагаться на чужие тесты.
Шаг 1. Выберите 3-5 задач из своей рутины. Разброс по сложности — обязательно, не берите только простые или только сложные.
Шаг 2. Обезличьте данные перед загрузкой. Замените названия контрагентов, округлите суммы, замаскируйте номера договоров и ИНН.
Шаг 3. Засеките время на обе версии. Сначала вручную с фиксацией времени, потом с нейросетью — отдельно время ответа и отдельно время проверки.
Шаг 4. Проверьте результат построчно на первых прогонах. Не доверяйте с первого раза, сверьте расчёт вручную хотя бы на паре задач.
Шаг 5. Зафиксируйте результат в личной таблице. Задача, время вручную, время с ИИ, найденные ошибки, итоговая экономия — через 10-15 задач у вас будет карта, где доверять сразу, а где перепроверять дважды.
Десять промптов из теста, которые можно взять сразу
Все промпты ниже — с явной защитой от неточных данных и с просьбой считать в коде, там где это применимо.
Промпт 1. Извлечение данных из скана документа.
Ты финансовый аналитик с 10+ лет опыта работы с первичной
документацией. Прикладываю обезличенный скан или PDF документа.
Задача: извлеки структурированные данные в таблицу:
тип документа, дата, номер, контрагент (маска),
сумма без НДС, НДС, итого.
Если поле не читается или отсутствует, пиши «не указано».
Не додумывай данные, которых нет на скане.
Если скан плохого качества — отдельно отметь это в конце.
Промпт 2. Сверка реестра с банковской выпиской.
Ты финансовый контролёр с 10+ лет опыта в сверках.
Прикладываю два обезличенных файла: реестр платежей
(дата, контрагент_маска, сумма, статья) и банковскую
выписку за тот же период (дата, контрагент_маска, сумма).
Задача: посчитай расхождения в коде на Python.
Раздели на три категории: есть в реестре, нет в выписке;
есть в выписке, нет в реестре; совпадение с расхождением
по дате более 2 рабочих дней.
Формат: три таблицы, под каждой — сумма расхождений в рублях.
Промпт 3. Анализ отклонений план-факт с оговоркой на причины.
Ты финансовый директор с 10+ лет опыта в управленческом учёте.
Прикладываю обезличенную таблицу: статья, план, факт.
Задача: посчитай отклонения в коде (в рублях и процентах),
найди статьи с отклонением более 15%.
Для каждого значимого отклонения предложи 2-3 возможные
причины с явной пометкой «версия, требует подтверждения» —
не выдавай причину как установленный факт.
Формат: таблица отклонений + список топ-статей с версиями причин.
Промпт 4. Черновик ответа на требование ФНС с защитой от неточных ссылок.
Ты налоговый консультант с 10+ лет практики.
Прикладываю обезличенный текст требования ФНС.
Задача: сформируй черновик ответа — позицию в 2-3 предложениях,
список документов для приложения, список норм.
ВАЖНО: каждую ссылку на статью НК или письмо Минфина
помечай тегом [ПРОВЕРИТЬ НОМЕР И ДАТУ В КОНСУЛЬТАНТПЛЮС].
Не указывай номер документа, если не уверен — пиши
«найти актуальное письмо по теме X» вместо конкретного номера.
Промпт 5. Консолидация нескольких файлов с явным форматом.
Ты финансовый аналитик, специализирующийся на сведении данных.
Прикладываю [N] обезличенных файлов из разных источников.
Для каждого укажи явно: [файл 1 — формат сумм с точкой,
разделитель тысяч пробел; файл 2 — формат с запятой как
десятичным разделителем; и так далее].
Задача: свести все файлы в единую таблицу с нормализованными
датами (ГГГГ-ММ-ДД) и суммами (число с точкой, без разделителя
тысяч). Посчитай в коде, не вручную построчно.
После сведения покажи 5 случайных строк для проверки.
Промпт 6. Сценарный анализ с явными каскадными зависимостями.
Ты финансовый директор с 10+ лет опыта в финансовом планировании.
Прикладываю базовую финмодель. ВАЖНО — зависимости между
параметрами: переменные расходы = [X]% от выручки,
постоянные расходы не зависят от выручки, [добавьте
свои зависимости].
Задача: рассчитай три сценария (базовый, пессимистичный
выручка -20%, оптимистичный выручка +15%) с учётом
ВСЕХ указанных зависимостей. Считай в коде на Python.
Покажи промежуточный расчёт по каждому параметру,
не только итоговую EBITDA.
Промпт 7. Аудит договора на финансовые риски.
Ты юрист по коммерческим контрактам и финансовый контролёр
с 10+ лет практики, проверяешь договор глазами плательщика.
Прикладываю обезличенный текст договора.
Задача: найди рискованные для плательщика пункты — индексация,
штрафы, обеспечительные платежи, условия расторжения,
скрытые дополнительные расходы.
Используй только текст договора. Двусмысленные пункты
помечай явно как «требует юридического уточнения».
Формат: таблица (пункт, цитата не длиннее 15 слов, риск,
рекомендация) + итоговый вывод в 3 предложения.
Промпт 8. Тезисы для разговора с инвестором.
Ты CFO с 15+ лет опыта, который умеет доносить финансовые
данные без жаргона.
Прикладываю обезличенные квартальные данные.
Контекст: [отрасль, специфика бизнеса].
Задача: подготовь 5 ключевых тезисов (по 1-2 предложения),
3 вероятных вопроса инвестора с вариантами ответа,
и отдельно — чего не стоит говорить на этой встрече.
Используй только данные из приложения, не додумывай цифры.
Промпт 9. Поиск аномалий в большом реестре.
Ты финансовый аналитик-аудитор с 10+ лет практики.
Прикладываю обезличенный реестр платежей за квартал
(дата, контрагент_маска, сумма, статья, ЦФО).
Задача: найди в коде на Python: задвоенные платежи
(один контрагент, одна сумма, интервал до 3 дней);
контрагентов с ростом оборота более 50% к среднему
за квартал; округлённые суммы кратные 100 тыс. на
нетипичных статьях; платежи без привязки к договору.
Формат: 4 таблицы-результата, под каждой — количество
находок и суммарная сумма.
Промпт 10. Контрольная проверка любого финансового расчёта.
Ты независимый финансовый аудитор, твоя задача — не
согласиться с расчётом, а найти в нём ошибку.
Прикладываю расчёт [опишите задачу] и исходные данные.
Задача: пересчитай с нуля в коде на Python, не используя
готовый результат как отправную точку. Сравни свой расчёт
с приложенным. Если есть расхождение — укажи точную строку
и причину.
Не соглашайся с расчётом только потому, что он выглядит
правдоподобно.
Кейс: как ученица школы использовала протокол теста в своей компании
Юлия, финансовый менеджер производственной компании в Новосибирске, 6 лет опыта, применила похожий протокол теста на своих задачах после нашего курса.
Точка А. Ежемесячная сверка расходов по 4 цехам занимала у неё 3 часа, с частыми расхождениями, которые находились уже после закрытия месяца.
Что сделала. Протестировала промпт на сверку по образцу из задачи 2 этой статьи, засекла время на первых пяти прогонах, зафиксировала два случая, где GPT-5.5 неверно интерпретировал формат отрицательных сумм (в скобках вместо минуса).
Точка Б. После явного указания формата в промпте ошибка ушла. Сверка сократилась до 40 минут, включая проверку. За квартал Юлия накопила личную таблицу из 14 задач с пометками, где доверять с одной проверкой, а где перепроверять построчно. «Тест на своих данных дал мне больше уверенности, чем любая статья про то, что ИИ вообще может».
Кейс: как небольшая розничная сеть внедрила протокол проверки после первой ошибки
Второй кейс показателен именно потому, что начался с провала, а не с успеха. Артём, финансовый директор сети из 6 магазинов бытовой техники в Казани, начал использовать нейросеть для еженедельного отчёта по марже без выстроенного протокола проверки.
Точка А. Артём загружал выгрузку продаж в GPT-5.5, просил посчитать маржинальность по категориям и сразу вставлял результат в презентацию для совета директоров без сверки. Три недели подряд всё сходилось, и это создало ложное чувство безопасности.
Что пошло не так. На четвёртой неделе в выгрузке появилась строка с возвратом товара, оформленным отрицательной суммой продажи и положительной себестоимостью. Модель без специальной инструкции обработала эту строку как обычную продажу с отрицательной выручкой, что исказило маржинальность по одной категории почти на 15 процентных пунктов. Ошибка попала в презентацию и была замечена только на самом совете, когда один из директоров спросил, почему маржа по бытовой химии внезапно упала вдвое.
Что сделали после. Артём внедрил обязательное правило: перед любым отчётом для совета директоров модель получает промпт с явным описанием всех нетиповых типов строк в выгрузке (возвраты, корректировки, внутренние перемещения) и отдельно строит контрольную сумму по общей выручке, которая сверяется с итогом из 1С вручную за 3 минуты.
Точка Б. С тех пор за 5 месяцев ни одной подобной ошибки не повторилось. Время на подготовку еженедельного отчёта осталось почти таким же коротким, как было с самого начала — 20 минут вместо прежних 2 часов вручную — но добавились 3 минуты на контрольную сверку итога. «Я не отказался от нейросети после этого случая. Я понял, что мне не хватало ровно одного шага — контрольной точки, которую легко проверить руками. Теперь это в моём чек-листе на каждый отчёт», — говорит Артём.
Этот кейс — хорошая иллюстрация того, почему правило 4 из моего списка правил безопасной проверки (сверяйте контрольную точку вручную) я считаю не формальностью, а обязательным шагом, а не рекомендацией «для перфекционистов».
Сколько на самом деле стоит доступ к нейросетям для финансиста в России
Отдельный вопрос, который мне задают почти на каждом эфире: сколько реально стоит вся эта история с подпиской. Если сравнивать со временем, которое экономится, разговор о деньгах довольно короткий.
Платная подписка на большинство современных моделей стоит по официальному прайсу вендора — точную цифру проверяйте на сайте сервиса перед оплатой, так как тарифы регулярно меняются. Если взять консервативную оценку экономии в 10 часов в неделю при среднем использовании (а в моём тесте цифры были выше на отдельных категориях задач), это около 40 часов в месяц. При любой разумной оценке стоимости часа работы финансового специалиста подписка окупается кратно уже в первую неделю использования.
Отдельно стоит сказать про доступ из России: ни один из трёх сервисов в моём тесте не имеет официального прямого способа оплаты и входа из РФ на момент публикации статьи. Практика такая: используется способ подключения, отличный от прямого доступа, и оплата через посредника или локальный сервис-агрегатор. Я сознательно не даю в этой статье пошаговую инструкцию по конкретному способу обхода — это меняется чаще, чем публикуются статьи, и то, что работало вчера, может не работать сегодня. На бесплатной экскурсии школы я показываю актуальный на момент эфира рабочий вариант вживую, потому что там можно сразу ответить на уточняющие вопросы.
Более бюджетный путь — DeepSeek V3.2, который по моей практике на задачах с прозрачной, зафиксированной логикой расчёта (не требующих креативной интерпретации) справляется сопоставимо с более дорогими моделями при ощутимо более низкой стоимости использования. Я не включила его в основной девятизадачный тест этой статьи, потому что фокус был на сравнении трёх наиболее универсальных моделей, но он заслуживает отдельного раунда тестирования в будущей статье.
Как читать результаты этого теста, если у вас другая отрасль
Честно предупреждаю: цифры из этой статьи — это результат на конкретных девяти задачах с конкретными (пусть и типичными) данными. Если вы работаете в отрасли с сильно нестандартной документацией — например, строительство с актами КС-2/КС-3 и сложными формами, или ВЭД с валютными контрактами и таможенными декларациями — ваши реальные результаты могут отличаться в любую сторону.
Логика, которая переносится в любую отрасль, — не конкретные проценты экономии, а закономерность: чем более структурирована и повторяема задача, тем выше и надёжнее выигрыш ИИ. Чем больше в задаче специфичного отраслевого контекста, которого нет в обучающих данных модели и которого вы не прописали явно в промпте, тем осторожнее стоит относиться к результату без проверки.
Именно поэтому чек-лист теста на своих задачах в этой статье важнее, чем сама таблица с моими девятью результатами. Табличные цифры — это ориентир и мотивация попробовать, а не гарантия для вашей конкретной ситуации.
Хочешь так же протестировать нейросеть на своих задачах вживую, а не читать чужие результаты? Бесплатная экскурсия «AI для финансиста и бухгалтера», 2,5 часа практики на реальных кейсах.
Что дальше: от разового теста к системе
Один честный тест даёт вам карту доверия на 9 задач. Но рутина финансиста шире, и на каждую новую категорию задач стоит проводить свой мини-тест, а не доверять чужому результату вслепую — модели меняются, ваши данные отличаются от моих.
Есть ещё одна причина не останавливаться на разовом тесте: модели обновляются чаще, чем выходят статьи про них. То, что я протестировала в июле 2026 года, отражает конкретные версии GPT-5.5, Claude Sonnet 4.6 и Gemini 3.5 Flash на конкретную дату. Через полгода поведение моделей на тех же задачах может измениться — в лучшую или в непредсказуемую сторону. Разовый тест устаревает, а привычка тестировать — нет. Именно поэтому чек-лист выше в статье я считаю более ценной частью материала, чем таблица с конкретными процентами.
На курсе «AI-навыки финансиста» онлайн-школы «Финансовый директор | Мастер CFO» я и Софья Бурцева, основатель школы, разбираем не только готовые промпты, но и сам протокол проверки: как быстро понять, где конкретной модели можно доверять на ваших задачах, а где нужна двойная проверка. Отдельный модуль курса посвящён именно этому — построению личной системы верификации, а не заучиванию одного набора промптов, который устареет вместе со следующим обновлением модели. 10 модулей, 800+ выпускников, диплом установленного образца с лицензией, налоговый вычет 13%.
Записаться на курс «AI-навыки финансиста»
FAQ: частые вопросы про тест финансиста против нейросети
Какая нейросеть точнее для финансовых расчётов? В моём тесте Claude Sonnet 4.6 реже ошибался на многошаговых расчётах и длинных документах. GPT-5.5 был быстрее на структурированных задачах с чётким форматом ответа. Gemini 3.5 Flash удобнее при работе с большим числом файлов одновременно. Универсального лидера нет — важна конкретная категория задачи и то, насколько явно вы описали формат и зависимости в промпте.
Можно ли доверять расчёту ИИ без проверки? Нет. В 4 задачах из 9 в первом ответе была неточность — от неверного номера письма Минфина до заниженной на 8% EBITDA в сценарном анализе. Каждый расчёт, который влияет на решение или уходит во внешний документ (отчёт собственнику, ответ в налоговую, презентация инвестору), нужно проверять хотя бы выборочно.
Сколько времени экономит нейросеть в среднем? По итогам девяти задач — 72% времени, с учётом времени на проверку результата. Но экономия сильно зависит от категории: от 88% на разборе документов до 30% на сложном сценарном анализе, где пришлось искать и исправлять ошибку.
Где риск ошибки выше всего? На многошаговых каскадных расчётах, где один параметр зависит от другого, и в ситуациях, где часть исходных данных отсутствует, а модель должна была бы спросить, а не додумать значение самостоятельно.
Нужно ли уметь программировать для таких промптов? Нет. Просьба «посчитай в коде на Python» пишется на обычном русском языке внутри промпта, код пишет и выполняет сама модель — вам не нужно писать ни строчки кода лично.
Стоит ли использовать ИИ для отчётности перед налоговой? Только как черновик с обязательной пометкой на все нормативные ссылки и финальной проверкой специалистом. Ответственность за декларацию несёт человек, а не модель, поэтому финальное решение и подпись всегда должны оставаться за вами.
Что делать, если нейросеть дала два разных ответа на один и тот же вопрос в разных чатах? Это не редкость и не повод для паники — считайте это сигналом, что задача находится в зоне неопределённости для модели. Пересчитайте вручную или задайте вопрос третьей модели, чтобы понять, какой из двух ответов ближе к правильному.
Как часто нужно повторять тест на своих задачах? Я советую делать контрольную проверку раз в квартал на 2-3 ключевых задачах, особенно после заметных обновлений моделей. Полный повторный тест на всех задачах не нужен — достаточно нескольких контрольных точек, чтобы убедиться, что качество не просело и не выросло настолько, что стоит доверять модели больше, чем раньше.
Наши каналы для финансистов
Telegram @findir_pro — 45 000 подписчиков. Ежедневные разборы: промпты, кейсы, новости AI для финансиста. Главный канал сообщества.
Telegram «АИ с Софьей и Натали» — 13 000 подписчиков. Совместный канал с Софьей Бурцевой, основателем школы. Стратегические взгляды на AI в финансах, разборы трендов, личный опыт.
MAX «Финансовый директор» — 5 000+ участников. Закрытое сообщество с разборами кейсов, шаблонами и доступом к экспертным эфирам.
Об авторе
Натали Васильева. Эксперт по нейросетям и продюсер онлайн-школы «Финансовый директор | Мастер CFO». С нейросетями в работе финансиста с февраля 2023 года. Через курс «AI-навыки финансиста» прошли 800+ финансистов, главбухов и финдиров. Веду Telegram-канал @findir_pro (45 000 подписчиков) и MAX-канал «Финансовый директор» (5 000+).