← Вернуться к SAID SAID v1.0

ИИ выдумывает: от судебной хроники к корпоративному контуру

SAID — аналитический материал, июль 2026
Суды — единственная профессиональная среда, где каждую ссылку сгенерированного текста проверяет мотивированный оппонент: отсюда 1 667 задокументированных дел за три года, включая первый российский штраф. Что эта статистика означает для документов, которые с такой тщательностью не проверяет никто, — и почему ответ лежит в архитектуре, а не в памятках

В мае 2026 года Арбитражный суд Западно-Сибирского округа оштрафовал кемеровскую компанию на 50 000 рублей. Кассационная жалоба, составленная с помощью нейросети, ссылалась на акты Верховного суда РФ, упразднённого Высшего арбитражного суда и нескольких окружных судов — и ни одна ссылка не выдержала проверки. Часть решений не существовала вовсе, часть имела чужие реквизиты и относилась к другим спорам, а «дословные цитаты» модель сочинила. Суд расценил это как представление заведомо ложных сведений и попытку воздействовать на кассацию авторитетом высшей инстанции, отдельно оговорив: использовать ИИ при подготовке документов закон не запрещает, но ответственность за достоверность текста несёт тот, кто его подал.

Россия присоединилась к счёту, который мир ведёт с 2023 года. Ниже — почему выдумки языковых моделей видимы именно в судах, что об их частоте говорят замеры и что та же механика делает в корпоративных документах, где её никто не измеряет.

Суд как измерительный прибор

Когда модель выдумывает факт во внутренней записке, об этом чаще всего не узнаёт никто, включая автора записки. В суде та же ошибка запускает состязательную механику: противная сторона перепроверяет каждую ссылку, судья фиксирует находку в решении, решение попадает в открытый реестр. Судебная статистика — редкая область, где галлюцинации (hallucinations) ИИ подсчитывает независимая и мотивированная сторона, а не поставщик модели или её пользователь.

Самый длинный такой счётчик ведёт исследователь права Дамьен Шарлотен (HEC Paris): с апреля 2025 года он собирает в публичную базу судебные решения, в которых суд констатировал сгенерированный вымысел — несуществующие прецеденты, выдуманные цитаты, искажённые нормы. К середине 2026 года в базе 1 667 дел по всему миру против примерно 230 годом ранее — рост в семь раз. Темп сменился с месячного на дневной: только 31 марта 2026 года американские суды вынесли 17 решений с констатацией галлюцинаций.

Оговорки к этим цифрам скорее усиливают вывод. Критерий включения консервативный: галлюцинацию должен письменно зафиксировать сам суд, поэтому счёт заведомо неполный — слой ошибок, найденных и молча исправленных до подачи, не виден в принципе. Преобладание США — более тысячи дел — отражает не только масштаб, но и открытость американских судебных данных. Наконец, рост кривой смешивает два процесса: растёт и применение ИИ, и внимательность проверяющих, научившихся узнавать характерные артефакты генерации.

Фундамент: 800 тысяч запросов и 58–88% выдумки

Судебная хроника показывает следствия. Причину системно измерила группа Stanford RegLab в работе «Large Legal Fictions» (январь 2024 года): четырём моделям — GPT-4, GPT-3.5, PaLM 2 и Llama 2 на 13 млрд параметров — задали свыше 800 тысяч проверяемых вопросов о реальных американских судебных делах, от «существует ли такое дело» до «в чём суть постановления». Эталонные ответы брались из внешних баз метаданных, генерация шла при нулевой температуре — в самом консервативном режиме. Итог: выдуманный ответ в 58% случаев у GPT-4, 69% у GPT-3.5, 72% у PaLM 2 и 88% у Llama 2. На содержательных вопросах — тех, ради которых юрист и открывает базу прецедентов, — выдумка оказалась не сбоем, а преобладающим исходом.

Замер сделан на моделях конца 2023 года, только на фактологических вопросах американского права и в режиме «из памяти», без доступа к поиску; сегодняшние модели ошибались бы реже. Но три структурных свойства, воспроизведённые у всех четырёх участников, важнее конкретных процентов.

Первое — градиент ошибки. Модели уверенно воспроизводят хрестоматийные факты и фантазируют на «длинном хвосте» знаний: чем ниже уровень суда, свежее решение и реже цитируемость дела, тем выше частота выдумки. Второе — контрфактическое смещение (contra-factual bias): на вопрос с ложной посылкой — «почему судья выразил особое мнение в деле», в котором он его не выражал, — PaLM 2 достраивала связный ответ под ложную посылку в 99% случаев, GPT-4 — в 69%. Заблуждение пользователя возвращается к нему в виде развёрнутого уверенного обоснования. Третье — калибровка (calibration): все четыре модели систематически завышали уверенность в ответах, причём лидер по точности GPT-4 оказался откалиброван хуже более слабых конкурентов. Модели не видят собственных ошибок, поэтому фильтр «доверяем только уверенным ответам» построить не на чем.

Для контраста: рейтинг Vectara измеряет другую постановку — пересказ предоставленного документа. Там лучшие модели искажают источник менее чем в 2% случаев, худшие — примерно в четверти. Сравнивать эти проценты со стэнфордскими напрямую нельзя — задачи и метрики разные, — но порядок величин показателен: между режимами «ответь по памяти» и «перескажи приложенный документ» лежит разрыв в десятки раз.

Эскалация: от пяти тысяч долларов к дисквалификации

Цена ошибки растёт быстро. В июне 2023 года штраф в 5 000 долларов по делу Mata v. Avianca — юристы подали меморандум с шестью вымышленными решениями, сгенерированными ChatGPT, — выглядел экзотикой. В июне 2026-го судья Северного округа Миссисипи отстранила двух ведущих адвокатов от практики в округе на два года: документы с выдуманными источниками подали обе стороны спора. Между этими точками — штрафы по 15 000 долларов в апелляции шестого округа, бессрочное отстранение в Небраске, вычеркнутые экспертные заключения, повторные санкции одним и тем же лицам.

Удобное объяснение — «попадаются одиночки без ресурсов на проверку» — поначалу подтверждалось: по разбору Стэнфордского центра интернета и общества, около половины «адвокатских» дел приходилось на соло-практиков. В апреле 2026 года объяснение закрылось. Sullivan & Cromwell — фирма с более чем 900 юристами, консультирующая OpenAI, — подала срочное ходатайство в банкротном процессе в Нью-Йорке; оппоненты нашли в нём не меньше 28 ошибочных ссылок, включая цитаты, приписанные самому суду. Фирма признала галлюцинации письмом судье — и отдельно признала, что её собственные политики использования ИИ, с обязательными тренингами и требованием проверки, в этом срочном документе соблюдены не были.

У фирмы были регламенты, обучение и квалифицированные люди; не было только процедуры, которую нельзя обойти под дедлайном. Памятка проиграла срочности — как проигрывает ей в любой организации.

Российская хроника: штраф, Пленум и сам Верховный суд

Майское решение российского арбитража воспроизводит международный сценарий с точностью до деталей: те же выдуманные реквизиты, те же сочинённые цитаты, та же логика суда — инструмент не запрещён, ответственность на подписанте. Судебный штраф в 50 000 рублей скромнее американских санкций, но прецедентная роль сопоставима: это первое широко освещённое решение, где российский суд прямо назвал галлюцинации ИИ основанием для наказания. Показательно и то, как ошибку нашли: кассационная инстанция — одна из немногих сред, где реквизиты каждой ссылки сверяются с картотекой дел.

Верховный суд отреагировал системно, причём с двух сторон сразу. Постановление Пленума ВС РФ от 21 мая 2026 года № 15 о подготовке гражданских дел к разбирательству обязало участников процесса сообщать суду, если представляемые сведения о фактах получены с использованием ИИ. А месяцем раньше судья ВС рассказал, что при подготовке самих разъяснений Пленума ИИ применялся для сбора и обработки информации. Позиция ясна: вопрос не «применять или нет», а «раскрыто и проверено — или скрыто и на веру».

Регулятор информационной безопасности двигается в ту же сторону. Приказ ФСТЭК России от 11 апреля 2025 года № 117, вступивший в силу 1 марта 2026-го, впервые на нормативном уровне вводит требования к применению ИИ в государственных информационных системах: контроль достоверности ответов нейросетей, фильтрация пользовательских запросов, запрет использовать облачные AI-сервисы для сведений ограниченного доступа и передавать такие сведения разработчику модели. В декабре 2025-го ведомство впервые внесло связанные с ИИ угрозы в банк данных угроз безопасности и анонсировало стандарт безопасной разработки систем ИИ. Иными словами, то, что суд требует от юриста — проверку сгенерированного до подачи, — регулятор начинает требовать от оператора системы на уровне архитектуры.

Рамочное регулирование пока догоняет. Законопроект Минцифры «Об основах государственного регулирования сфер применения технологий искусственного интеллекта», опубликованный для обсуждения в марте 2026 года, за весну заметно смягчили: от обязательной маркировки сгенерированного контента отказались, а распределение ответственности за вред между разработчиком, оператором и владельцем сервиса свели к отсылочной формулировке «в соответствии с законодательством». На практике это означает, что действуют общие нормы, — и ориентиром остаётся логика канадского дела Moffatt v. Air Canada (2024): трибунал обязал авиакомпанию компенсировать пассажиру ущерб от выдуманного её чат-ботом «траурного тарифа», отклонив довод, что бот — «отдельное лицо, отвечающее за свои действия». За ответы систем на своём периметре отвечает компания; российский арбитраж в майском деле применил ту же логику к процессуальным документам.

Смежный риск — утечки: бесконтрольные публичные чат-боты выносят наружу не только выдумки. С 30 мая 2025 года действуют нормы 420-ФЗ: штрафы за утечку персональных данных — от 3 до 15 млн рублей в зависимости от объёма, за повторную — оборотные, от 1 до 3% годовой выручки, но не менее 20 и не более 500 млн рублей. Сотрудник, вставляющий в личный чат-бот фрагмент клиентской базы, чтобы «красиво переписать письмо», создаёт риски обоих классов одновременно: выдумка на выходе, утечка на входе.

Про русскоязычные модели честно сказать следующее: публичного замера, сопоставимого со стэнфордским, для них нет. Открытые бенчмарки — MERA для фундаментальных моделей на русском языке, SLAVA (РАНХиГС и ИСП РАН, более 14 тысяч заданий) для фактологичности российского социально-гуманитарного домена — оценивают качество ответов, но отраслевой статистики галлюцинаций в духе «Large Legal Fictions» не дают. Ранние практические тесты GigaChat и YandexGPT в задачах генерации с опорой на документы (retrieval-augmented generation, RAG) на русскоязычных корпусах показывали заметное отставание от GPT-4 того же периода; поколения моделей с тех пор сменились, и разработчики заявляют о снижении частоты выдумки. Для практики важно другое: галлюцинации — свойство метода генерации, а не конкретного вендора или языка, и строить контур в расчёте «наша модель не выдумывает» оснований нет — ни для зарубежных систем, ни для отечественных.

Невидимая часть айсберга: корпоративный контур

Что эта хроника говорит о средах без состязательной проверки? Судебная выборка описывает область с максимальным встроенным контролем — мотивированный оппонент, персональная подпись под каждым документом, публичные санкции. Если такая среда за три года накопила 1 667 публично зафиксированных провалов, и это заведомый недоучёт, разумно исходить из того, что в аналитических записках, технических спецификациях, ответах регуляторам и коммерческих предложениях частота ошибок не ниже. Видимость же — около нуля: эти документы никто не читает с враждебной тщательностью оппонирующего юриста.

Стэнфордский градиент ошибки делает корпоративный прогноз хуже судебного. Американский судебный корпус огромен, публичен и частично попал в обучающие данные — и всё равно модели выдумывают его периферию. Приказов, регламентов и договоров конкретного предприятия в обучающем корпусе нет вовсе: вопрос о внутренней парольной политике, заданный модели без доступа к источникам, вернёт правдоподобный пересказ «средней по интернету» политики — уверенным тоном и, возможно, с выдуманным номером приказа. Добавьте теневой ИИ (shadow AI) — работу сотрудников через личные чат-боты вне поля зрения службы ИБ — и получится судебная механика без судьи: ошибку найдёт не оппонент до вынесения решения, а клиент или регулятор после.

Ответ: архитектура вместо памятки

Судебная хроника уже провела за всех три эксперимента. Политики и тренинги без встроенной процедуры не работают — показано на фирме с 900 юристами. Проверка генерации тем же классом инструментов не работает — адвокат, сверявший цитаты одного чат-бота через другой, оштрафован. Самооценка модели не работает — калибровочные данные показывают, что уверенность ответа не связана с его истинностью. Остаётся один класс решений: проверка, внешняя по отношению к модели и встроенная в поток работы так, чтобы её нельзя было пропустить под дедлайном.

Из тех же данных складывается конструкция такой проверки.

Нет источника — нет ответа. На фактические вопросы система отвечает только по документам, с обязательной ссылкой на конкретный источник; ответ без ссылки отбрасывается на уровне архитектуры, а не по усмотрению сотрудника. Разрыв между 58–88% выдумки «из памяти» и единицами процентов искажений при пересказе документа — измеренная цена этого правила.

Домен знаний с переносом прав доступа. Источником служит выверенный корпус документов предприятия, а не интернет-корпус модели; права доступа агента наследуются от прав спрашивающего — система не покажет сотруднику документ, который ему не положен, и не сошлётся на него.

Минимальный контекст агента. Чем уже домен и конкретнее задача, тем меньше пространства для фантазий и тем дешевле их отлов; универсальный «отвечатель на всё» — худшая из возможных конфигураций.

Единая точка доступа к моделям с контролем утечек данных (data loss prevention, DLP). Все обращения к моделям — внешним и внутренним — идут через один шлюз, трафик которого контролируется так же, как почта и мессенджеры; на российском рынке этот класс систем представлен, в частности, InfoWatch Traffic Monitor и Solar Dozor. Один канал закрывает два риска — теневой ИИ и утечки с их оборотными штрафами.

Проверка каждого действия до выполнения. Сверка ссылок и цитат с первоисточником выполняется автоматически до выдачи ответа или отправки документа — так же, как кассация сверяла реквизиты с картотекой, только до инцидента, а не после. Для сгенерированного кода эквивалент — обязательный статический анализ (static application security testing, SAST) до слияния изменений; на российском рынке — PT Application Inspector, Solar appScreener.

Управляемый доступ вместо запрета. Запрет публичных чат-ботов не устраняет ни одного из описанных эффектов — он лишь выводит их из зоны видимости. Хроника Шарлотена полна дел, где ИИ применяли вопреки регламентам и скрывали это; раскрытие и контроль работают лучше, что теперь закреплено и позицией Пленума ВС.

Журнал, по которому восстановим инцидент. Для каждого ответа фиксируется, кто спрашивал, какая модель отвечала и на какие источники опиралась. Если ошибка всё же ушла наружу, у разбора есть фактическая база, а не пересказ сотрудником того, «что он спрашивал у бота».

Что внедрить: короткий список

Об авторе: материал подготовлен разработчиками методологии безопасного внедрения ИИ SAID (said.implica.ru).

Источники

  1. Damien Charlotin. AI Hallucination Cases Database — damiencharlotin.com, обновляется ежедневно (данные на июль 2026).
  2. Dahl M., Magesh V., Suzgun M., Ho D.E. Large Legal Fictions: Profiling Legal Hallucinations in Large Language Models — Journal of Legal Analysis / arXiv:2401.01301, январь 2024.
  3. Hallucinating Law: Legal Mistakes with Large Language Models Are Pervasive — Stanford HAI, 11.01.2024.
  4. Mata v. Avianca, Inc., 678 F. Supp. 3d 443 (S.D.N.Y.) — решение о санкциях, 22.06.2023.
  5. Moffatt v. Air Canada, 2024 BCCRT 149 — Civil Resolution Tribunal Британской Колумбии, февраль 2024.
  6. An AI Screw-Up By… Sullivan & Cromwell? — David Lat, Original Jurisdiction, апрель 2026.
  7. Lawyers Suspended After Fake AI Citations in Lawsuit — JDJournal, 09.06.2026.
  8. In One Day (Mar. 31), 17 U.S. Court Decisions Noting Suspected AI Hallucinations in Court Filings — The Volokh Conspiracy / Reason, 06.04.2026.
  9. Who's Submitting AI-Tainted Filings in Court? — Riana Pfefferkorn, Stanford Center for Internet and Society, октябрь 2025.
  10. Vectara Hallucination Leaderboard (HHEM-2.3) — github.com/vectara/hallucination-leaderboard, май 2026.
  11. Штраф за использование нейросети при составлении жалобы: решение вынес Арбитражный суд Западно-Сибирского округа — «Фонтанка.ру», 16.05.2026.
  12. Российский суд впервые оштрафовал компанию за ИИ-галлюцинации в судебном документе — «Системный Блокъ», май 2026.
  13. Штраф за «галлюцинации» ИИ в процессуальных документах: кто заплатит и как избежать — Право.ру, 2026.
  14. Участвующие в гражданском деле лица должны сообщать суду об использовании ИИ — ГАРАНТ.РУ, май 2026 (о постановлении Пленума ВС РФ от 21.05.2026 № 15).
  15. Верховный суд использовал ИИ для подготовки разъяснений, сообщил судья — РИА Новости, 21.04.2026.
  16. Требования, утверждённые приказом ФСТЭК России от 11.04.2025 № 117 — fstec.ru, действуют с 01.03.2026.
  17. Власти впервые выделили ИИ в качестве угрозы кибербезопасности — CNews, декабрь 2025.
  18. ФСТЭК взялась за разработку стандарта безопасной разработки искусственного интеллекта — ComNews, 19.09.2025.
  19. Персональные данные: новые штрафы с 30 мая 2025 года — КонсультантПлюс, 2025 (о Федеральном законе от 30.11.2024 № 420-ФЗ).
  20. Законопроект «Об основах государственного регулирования сфер применения технологий искусственного интеллекта в Российской Федерации» — regulation.gov.ru, март 2026; о доработке — CNews, 07.04.2026.
  21. Большой тест GPT4, GPT3.5, YandexGPT, GigaChat, Saiga в RAG-задаче — Хабр, январь 2024.
  22. SLAVA: Benchmark of Sociopolitical Landscape and Value Analysis — Proceedings of ISP RAS, 37:3, 2025.
  23. MERA — открытый бенчмарк оценки фундаментальных моделей для русского языка — mera.a-ai.ru.