В июне 2023 года федеральный судья Кевин Кастел оштрафовал двух нью-йоркских юристов и их фирму на 5 000 долларов: меморандум по делу Mata v. Avianca опирался на шесть вымышленных судебных решений. Тексты, цитаты и внутренние ссылки сгенерировал ChatGPT — и на прямой вопрос юриста, реальны ли дела, заверил, что они «существуют» и «находятся в авторитетных правовых базах LexisNexis и Westlaw». Суд расценил подачу такого документа как недобросовестную по правилу 11 Федеральных правил гражданского процесса (FRCP).
В феврале 2024 года трибунал Британской Колумбии обязал Air Canada выплатить пассажиру 812 канадских долларов: чат-бот на сайте авиакомпании выдумал условие «траурного тарифа», пообещав, что часть из 1 630 долларов, уплаченных за билеты, вернут при обращении в течение 90 дней после покупки — вопреки действующей политике. Авиакомпания доказывала, что бот — «отдельное лицо, отвечающее за свои действия»; трибунал довод отклонил: за все сведения на сайте, включая сгенерированные, отвечает компания (Moffatt v. Air Canada, 2024 BCCRT 149).
Оба эпизода — проявления одной механики. Насколько она массова, впервые системно измерила группа Stanford RegLab в работе «Large Legal Fictions» (Дал, Магеш, Сюзгюн, Хо, январь 2024).
Авторы взяли по 5 000 случайных дел с каждого из трёх уровней федеральной судебной системы США — Верховный суд, апелляционные округа, районные суды — со стратификацией по годам и округам. Эталонные ответы брались из внешних баз метаданных (Caselaw Access Project, Supreme Court Database, Shepard's Citations): на самих текстах решений модели, скорее всего, обучались, а на этих табличных метаданных — вряд ли, что и позволяет ловить выдумку.
Четырём моделям — GPT 4, GPT 3.5, PaLM 2 и Llama 2 (13 млрд параметров) — задавали 14 типов вопросов трёх уровней сложности:
Всего выполнено более 800 тысяч запросов, свыше 200 тысяч на модель, при нулевой температуре — в самом консервативном режиме генерации. Для сложных вопросов, где готового эталона нет, галлюцинацию (hallucination) ловили через самопротиворечие: модель спрашивали дважды и фиксировали логический конфликт ответов. Такой замер даёт только нижнюю границу частоты ошибок — устойчиво повторяемая выдумка в него не попадает.
На прямой проверяемый вопрос о случайном федеральном деле модели отвечали выдумкой в 58% случаев (GPT 4), 69% (GPT 3.5), 72% (PaLM 2) и 88% (Llama 2). Частота растёт со сложностью задачи:
Иначе говоря, на содержательных вопросах — тех, ради которых юрист и открывает базу прецедентов, — выдумка была не сбоем, а преобладающим исходом.
Ошибки распределены закономерно. Чем ниже уровень суда, тем выше частота галлюцинаций: лучше всего модели знают Верховный суд, хуже всего — районные суды, где начинается большинство реальных тяжб. Среди апелляционных округов точнее покрыты «знаменитые» Второй, Третий и Девятый; хуже всех — округ Колумбия (D.C. Circuit). Во времени знание тоже неоднородно: реже всего модели ошибались на решениях эпохи суда Уоррена (1953–1969), чаще — на самых старых и на самых свежих делах. Авторы описывают это как многолетнее отставание пикового знания модели от текущего состояния доктрины.
Тот же градиент — по известности: для дел из верхних 10% по цитируемости частота ошибок резко падает. Модель уверенно воспроизводит хрестоматийные факты и фантазирует на «длинном хвосте» — именно там, где пользователю нужна помощь, а не пересказ учебника. Отсюда вывод Stanford HAI: сильнее всего рискуют те, кому языковые модели могли бы помочь больше всех, — стороны без ресурсов на юристов, судящиеся в нижних судах.
Два дополнительных эксперимента важнее базовых процентов. Первый — проверка контрфактического смещения (contra-factual bias): моделям задавали вопросы с заведомо ложной посылкой — «почему судья X выразил особое мнение в деле Y» (в котором он его не выражал) или «в каком году отменили решение Z» (которое никогда не отменяли). Корректная реакция — возразить. PaLM 2 принимал ложную посылку и достраивал под неё связный ответ в 99% случаев, GPT 4 — в 69%, GPT 3.5 — в 52%. Llama 2 формально возражала почти всегда, но часто в форме «такого дела не существует» — отрицая реальные дела и реальных судей. Для пользователя-неспециалиста это тяжёлый сценарий: собственное заблуждение возвращается к нему в виде развёрнутого, уверенного обоснования.
Второй — калибровка (calibration), способность модели «знать, что она знает». Уверенность моделей сравнили с фактической точностью через ожидаемую ошибку калибровки (expected calibration error, ECE). Все четыре модели систематически завышали уверенность — ошибка везде в одну сторону. Показательно, что GPT 4, лидер по точности, калиброван хуже, чем GPT 3.5 и PaLM 2 (ECE 0,19 против 0,10 и 0,06): когда он всё же выдумывает, то делает это убедительнее других. Идею «спросим модель, насколько она уверена, и отфильтруем сомнительное» данные не поддерживают.
Замер сделан в конце 2023 года на моделях того поколения (gpt-4-1106-preview, gpt-3.5-turbo-0613, text-bison-001, Llama-2-13b-chat); Llama 2 взята в младшей версии, и её 88% не характеризуют линейку в целом. Исследование покрывает только американское прецедентное право и только фактологические вопросы — способность моделей к рассуждению в нём не оценивалась. Частоты для сложных задач — нижние границы, а сами 58–88% относятся к ответам «из памяти», без доступа к базам и поиску.
Для контраста: рейтинг галлюцинаций Vectara измеряет другую постановку — модель пересказывает предоставленный ей документ. Там лучшие модели искажают источник менее чем в 2% случаев, худшие — примерно в четверти (детектор HHEM-2.3, свыше 7 700 документов, обновление за май 2026 года). Сравнивать эти проценты напрямую со стэнфордскими нельзя — задачи и метрики разные, — но порядок величин показателен: между режимами «ответь по памяти» и «перескажи приложенный текст» лежит разрыв в десятки раз.
Американский судебный корпус — удобная модель внутренней базы знаний. Он огромен, публичен и частично попал в обучающие данные — и всё равно модели уверенно выдумывают его содержание на периферии: нижние суды, свежие решения, малоцитируемые дела. Документы предприятия находятся в заведомо худшем положении: приказов, регламентов, схем сетей и договоров в обучающем корпусе нет вовсе. Вопрос о вашей парольной политике, заданный модели без доступа к источникам, вернёт правдоподобный пересказ «средней по интернету» политики — с уверенной интонацией и, возможно, с выдуманным номером приказа.
Переносятся и оба поведенческих эффекта. Сотрудник, спросивший «почему регламент N запрещает X» (хотя не запрещает), рискует получить обоснование несуществующей нормы — подыгрывание пользователю (sycophancy) не привязано к юридическому домену. А раз модели переоценивают уверенность, фильтр «доверяем только уверенным ответам» построить не на чем: убедительность ответа не служит признаком его истинности. Проверка обязана быть внешней по отношению к модели — по источникам, а не по её самооценке. Дело Moffatt добавляет юридическое измерение: за выдумку клиентского чат-бота отвечает компания, аргумент «это сказал бот» трибунал уже отклонил.
В методологии SAID «ИИ выдумывает» — первая из трёх проблем доверия, рядом с утечками данных и тем, что собственные данные предприятия остаются незадействованными. Стэнфордский замер даёт ей количественное основание: без опоры на источники выдумка на фактических вопросах — статистически преобладающий режим работы модели, а не редкий сбой. При этом три структурных свойства — фантазии на «длинном хвосте» знаний, принятие ложных посылок и систематическая самоуверенность — воспроизвелись у всех четырёх участников замера, независимо от их места в рейтинге.
Контраст с задачами пересказа подтверждает инженерное направление ответа: давать модели источник, требовать привязки к нему и выносить проверку наружу — в управляющий слой, который сверяет цитаты с первоисточником так же, как судья Кастел сверял выдуманные прецеденты. Разница в том, что у предприятия эта сверка может выполняться автоматически и до выдачи ответа, а не после подачи документов в суд.
Методология отвечает на проблему «ИИ выдумывает» архитектурно, а не памяткой «перепроверяйте ответы». Правило 8 («нет источника — нет ответа») запрещает агенту отвечать на фактические вопросы из параметрической памяти: ответ строится по документам домена знаний с обязательной ссылкой — режим генерации с опорой на документы (RAG), в котором, по данным Vectara, лучшие модели искажают источник в единицах процентов против десятков в режиме «по памяти». Правило 6 проводит все диалоги через AI-шлюз с контролем утечек данных (DLP): для каждого ответа фиксируется, из какого источника он взят. Правило 13 добавляет управляющий слой (Control Plane), сверяющий цитаты ответа с первоисточником до выдачи пользователю, — стэнфордские данные о калибровке показывают, что самооценке модели эту работу доверить нельзя. Правило 5 требует проверять AI-код и AI-тексты как написанные посторонним, правило 3 сужает окно агента до минимального контекста — чем уже домен, тем меньше пространства для фантазий и тем дешевле их отлов. Правило 11 переводит всё это в режим «разрешить и контролировать»: запрет публичных чат-ботов проблему не решает, а лишь уводит её в теневой ИИ (shadow AI), где выдумки уже никто не сверяет.