В мае 2026 года Арбитражный суд Западно-Сибирского округа оштрафовал кемеровскую компанию на 50 000 рублей. Кассационная жалоба, составленная с помощью нейросети, ссылалась на акты Верховного суда РФ, упразднённого Высшего арбитражного суда и нескольких окружных судов — и ни одна ссылка не выдержала проверки. Часть решений не существовала вовсе, часть имела чужие реквизиты и относилась к другим спорам, а «дословные цитаты» модель сочинила. Суд расценил это как представление заведомо ложных сведений и попытку воздействовать на кассацию авторитетом высшей инстанции, отдельно оговорив: использовать ИИ при подготовке документов закон не запрещает, но ответственность за достоверность текста несёт тот, кто его подал.
Россия присоединилась к счёту, который мир ведёт с 2023 года. Ниже — почему выдумки языковых моделей видимы именно в судах, что об их частоте говорят замеры и что та же механика делает в корпоративных документах, где её никто не измеряет.
Когда модель выдумывает факт во внутренней записке, об этом чаще всего не узнаёт никто, включая автора записки. В суде та же ошибка запускает состязательную механику: противная сторона перепроверяет каждую ссылку, судья фиксирует находку в решении, решение попадает в открытый реестр. Судебная статистика — редкая область, где галлюцинации (hallucinations) ИИ подсчитывает независимая и мотивированная сторона, а не поставщик модели или её пользователь.
Самый длинный такой счётчик ведёт исследователь права Дамьен Шарлотен (HEC Paris): с апреля 2025 года он собирает в публичную базу судебные решения, в которых суд констатировал сгенерированный вымысел — несуществующие прецеденты, выдуманные цитаты, искажённые нормы. К середине 2026 года в базе 1 667 дел по всему миру против примерно 230 годом ранее — рост в семь раз. Темп сменился с месячного на дневной: только 31 марта 2026 года американские суды вынесли 17 решений с констатацией галлюцинаций.
Оговорки к этим цифрам скорее усиливают вывод. Критерий включения консервативный: галлюцинацию должен письменно зафиксировать сам суд, поэтому счёт заведомо неполный — слой ошибок, найденных и молча исправленных до подачи, не виден в принципе. Преобладание США — более тысячи дел — отражает не только масштаб, но и открытость американских судебных данных. Наконец, рост кривой смешивает два процесса: растёт и применение ИИ, и внимательность проверяющих, научившихся узнавать характерные артефакты генерации.
Судебная хроника показывает следствия. Причину системно измерила группа Stanford RegLab в работе «Large Legal Fictions» (январь 2024 года): четырём моделям — GPT-4, GPT-3.5, PaLM 2 и Llama 2 на 13 млрд параметров — задали свыше 800 тысяч проверяемых вопросов о реальных американских судебных делах, от «существует ли такое дело» до «в чём суть постановления». Эталонные ответы брались из внешних баз метаданных, генерация шла при нулевой температуре — в самом консервативном режиме. Итог: выдуманный ответ в 58% случаев у GPT-4, 69% у GPT-3.5, 72% у PaLM 2 и 88% у Llama 2. На содержательных вопросах — тех, ради которых юрист и открывает базу прецедентов, — выдумка оказалась не сбоем, а преобладающим исходом.
Замер сделан на моделях конца 2023 года, только на фактологических вопросах американского права и в режиме «из памяти», без доступа к поиску; сегодняшние модели ошибались бы реже. Но три структурных свойства, воспроизведённые у всех четырёх участников, важнее конкретных процентов.
Первое — градиент ошибки. Модели уверенно воспроизводят хрестоматийные факты и фантазируют на «длинном хвосте» знаний: чем ниже уровень суда, свежее решение и реже цитируемость дела, тем выше частота выдумки. Второе — контрфактическое смещение (contra-factual bias): на вопрос с ложной посылкой — «почему судья выразил особое мнение в деле», в котором он его не выражал, — PaLM 2 достраивала связный ответ под ложную посылку в 99% случаев, GPT-4 — в 69%. Заблуждение пользователя возвращается к нему в виде развёрнутого уверенного обоснования. Третье — калибровка (calibration): все четыре модели систематически завышали уверенность в ответах, причём лидер по точности GPT-4 оказался откалиброван хуже более слабых конкурентов. Модели не видят собственных ошибок, поэтому фильтр «доверяем только уверенным ответам» построить не на чем.
Для контраста: рейтинг Vectara измеряет другую постановку — пересказ предоставленного документа. Там лучшие модели искажают источник менее чем в 2% случаев, худшие — примерно в четверти. Сравнивать эти проценты со стэнфордскими напрямую нельзя — задачи и метрики разные, — но порядок величин показателен: между режимами «ответь по памяти» и «перескажи приложенный документ» лежит разрыв в десятки раз.
Цена ошибки растёт быстро. В июне 2023 года штраф в 5 000 долларов по делу Mata v. Avianca — юристы подали меморандум с шестью вымышленными решениями, сгенерированными ChatGPT, — выглядел экзотикой. В июне 2026-го судья Северного округа Миссисипи отстранила двух ведущих адвокатов от практики в округе на два года: документы с выдуманными источниками подали обе стороны спора. Между этими точками — штрафы по 15 000 долларов в апелляции шестого округа, бессрочное отстранение в Небраске, вычеркнутые экспертные заключения, повторные санкции одним и тем же лицам.
Удобное объяснение — «попадаются одиночки без ресурсов на проверку» — поначалу подтверждалось: по разбору Стэнфордского центра интернета и общества, около половины «адвокатских» дел приходилось на соло-практиков. В апреле 2026 года объяснение закрылось. Sullivan & Cromwell — фирма с более чем 900 юристами, консультирующая OpenAI, — подала срочное ходатайство в банкротном процессе в Нью-Йорке; оппоненты нашли в нём не меньше 28 ошибочных ссылок, включая цитаты, приписанные самому суду. Фирма признала галлюцинации письмом судье — и отдельно признала, что её собственные политики использования ИИ, с обязательными тренингами и требованием проверки, в этом срочном документе соблюдены не были.
У фирмы были регламенты, обучение и квалифицированные люди; не было только процедуры, которую нельзя обойти под дедлайном. Памятка проиграла срочности — как проигрывает ей в любой организации.
Майское решение российского арбитража воспроизводит международный сценарий с точностью до деталей: те же выдуманные реквизиты, те же сочинённые цитаты, та же логика суда — инструмент не запрещён, ответственность на подписанте. Судебный штраф в 50 000 рублей скромнее американских санкций, но прецедентная роль сопоставима: это первое широко освещённое решение, где российский суд прямо назвал галлюцинации ИИ основанием для наказания. Показательно и то, как ошибку нашли: кассационная инстанция — одна из немногих сред, где реквизиты каждой ссылки сверяются с картотекой дел.
Верховный суд отреагировал системно, причём с двух сторон сразу. Постановление Пленума ВС РФ от 21 мая 2026 года № 15 о подготовке гражданских дел к разбирательству обязало участников процесса сообщать суду, если представляемые сведения о фактах получены с использованием ИИ. А месяцем раньше судья ВС рассказал, что при подготовке самих разъяснений Пленума ИИ применялся для сбора и обработки информации. Позиция ясна: вопрос не «применять или нет», а «раскрыто и проверено — или скрыто и на веру».
Регулятор информационной безопасности двигается в ту же сторону. Приказ ФСТЭК России от 11 апреля 2025 года № 117, вступивший в силу 1 марта 2026-го, впервые на нормативном уровне вводит требования к применению ИИ в государственных информационных системах: контроль достоверности ответов нейросетей, фильтрация пользовательских запросов, запрет использовать облачные AI-сервисы для сведений ограниченного доступа и передавать такие сведения разработчику модели. В декабре 2025-го ведомство впервые внесло связанные с ИИ угрозы в банк данных угроз безопасности и анонсировало стандарт безопасной разработки систем ИИ. Иными словами, то, что суд требует от юриста — проверку сгенерированного до подачи, — регулятор начинает требовать от оператора системы на уровне архитектуры.
Рамочное регулирование пока догоняет. Законопроект Минцифры «Об основах государственного регулирования сфер применения технологий искусственного интеллекта», опубликованный для обсуждения в марте 2026 года, за весну заметно смягчили: от обязательной маркировки сгенерированного контента отказались, а распределение ответственности за вред между разработчиком, оператором и владельцем сервиса свели к отсылочной формулировке «в соответствии с законодательством». На практике это означает, что действуют общие нормы, — и ориентиром остаётся логика канадского дела Moffatt v. Air Canada (2024): трибунал обязал авиакомпанию компенсировать пассажиру ущерб от выдуманного её чат-ботом «траурного тарифа», отклонив довод, что бот — «отдельное лицо, отвечающее за свои действия». За ответы систем на своём периметре отвечает компания; российский арбитраж в майском деле применил ту же логику к процессуальным документам.
Смежный риск — утечки: бесконтрольные публичные чат-боты выносят наружу не только выдумки. С 30 мая 2025 года действуют нормы 420-ФЗ: штрафы за утечку персональных данных — от 3 до 15 млн рублей в зависимости от объёма, за повторную — оборотные, от 1 до 3% годовой выручки, но не менее 20 и не более 500 млн рублей. Сотрудник, вставляющий в личный чат-бот фрагмент клиентской базы, чтобы «красиво переписать письмо», создаёт риски обоих классов одновременно: выдумка на выходе, утечка на входе.
Про русскоязычные модели честно сказать следующее: публичного замера, сопоставимого со стэнфордским, для них нет. Открытые бенчмарки — MERA для фундаментальных моделей на русском языке, SLAVA (РАНХиГС и ИСП РАН, более 14 тысяч заданий) для фактологичности российского социально-гуманитарного домена — оценивают качество ответов, но отраслевой статистики галлюцинаций в духе «Large Legal Fictions» не дают. Ранние практические тесты GigaChat и YandexGPT в задачах генерации с опорой на документы (retrieval-augmented generation, RAG) на русскоязычных корпусах показывали заметное отставание от GPT-4 того же периода; поколения моделей с тех пор сменились, и разработчики заявляют о снижении частоты выдумки. Для практики важно другое: галлюцинации — свойство метода генерации, а не конкретного вендора или языка, и строить контур в расчёте «наша модель не выдумывает» оснований нет — ни для зарубежных систем, ни для отечественных.
Что эта хроника говорит о средах без состязательной проверки? Судебная выборка описывает область с максимальным встроенным контролем — мотивированный оппонент, персональная подпись под каждым документом, публичные санкции. Если такая среда за три года накопила 1 667 публично зафиксированных провалов, и это заведомый недоучёт, разумно исходить из того, что в аналитических записках, технических спецификациях, ответах регуляторам и коммерческих предложениях частота ошибок не ниже. Видимость же — около нуля: эти документы никто не читает с враждебной тщательностью оппонирующего юриста.
Стэнфордский градиент ошибки делает корпоративный прогноз хуже судебного. Американский судебный корпус огромен, публичен и частично попал в обучающие данные — и всё равно модели выдумывают его периферию. Приказов, регламентов и договоров конкретного предприятия в обучающем корпусе нет вовсе: вопрос о внутренней парольной политике, заданный модели без доступа к источникам, вернёт правдоподобный пересказ «средней по интернету» политики — уверенным тоном и, возможно, с выдуманным номером приказа. Добавьте теневой ИИ (shadow AI) — работу сотрудников через личные чат-боты вне поля зрения службы ИБ — и получится судебная механика без судьи: ошибку найдёт не оппонент до вынесения решения, а клиент или регулятор после.
Судебная хроника уже провела за всех три эксперимента. Политики и тренинги без встроенной процедуры не работают — показано на фирме с 900 юристами. Проверка генерации тем же классом инструментов не работает — адвокат, сверявший цитаты одного чат-бота через другой, оштрафован. Самооценка модели не работает — калибровочные данные показывают, что уверенность ответа не связана с его истинностью. Остаётся один класс решений: проверка, внешняя по отношению к модели и встроенная в поток работы так, чтобы её нельзя было пропустить под дедлайном.
Из тех же данных складывается конструкция такой проверки.
Нет источника — нет ответа. На фактические вопросы система отвечает только по документам, с обязательной ссылкой на конкретный источник; ответ без ссылки отбрасывается на уровне архитектуры, а не по усмотрению сотрудника. Разрыв между 58–88% выдумки «из памяти» и единицами процентов искажений при пересказе документа — измеренная цена этого правила.
Домен знаний с переносом прав доступа. Источником служит выверенный корпус документов предприятия, а не интернет-корпус модели; права доступа агента наследуются от прав спрашивающего — система не покажет сотруднику документ, который ему не положен, и не сошлётся на него.
Минимальный контекст агента. Чем уже домен и конкретнее задача, тем меньше пространства для фантазий и тем дешевле их отлов; универсальный «отвечатель на всё» — худшая из возможных конфигураций.
Единая точка доступа к моделям с контролем утечек данных (data loss prevention, DLP). Все обращения к моделям — внешним и внутренним — идут через один шлюз, трафик которого контролируется так же, как почта и мессенджеры; на российском рынке этот класс систем представлен, в частности, InfoWatch Traffic Monitor и Solar Dozor. Один канал закрывает два риска — теневой ИИ и утечки с их оборотными штрафами.
Проверка каждого действия до выполнения. Сверка ссылок и цитат с первоисточником выполняется автоматически до выдачи ответа или отправки документа — так же, как кассация сверяла реквизиты с картотекой, только до инцидента, а не после. Для сгенерированного кода эквивалент — обязательный статический анализ (static application security testing, SAST) до слияния изменений; на российском рынке — PT Application Inspector, Solar appScreener.
Управляемый доступ вместо запрета. Запрет публичных чат-ботов не устраняет ни одного из описанных эффектов — он лишь выводит их из зоны видимости. Хроника Шарлотена полна дел, где ИИ применяли вопреки регламентам и скрывали это; раскрытие и контроль работают лучше, что теперь закреплено и позицией Пленума ВС.
Журнал, по которому восстановим инцидент. Для каждого ответа фиксируется, кто спрашивал, какая модель отвечала и на какие источники опиралась. Если ошибка всё же ушла наружу, у разбора есть фактическая база, а не пересказ сотрудником того, «что он спрашивал у бота».
Об авторе: материал подготовлен разработчиками методологии безопасного внедрения ИИ SAID (said.implica.ru).