Citações Alucinadas Dentro de Citações Reais: A Perigosa Falha da IA Jurídica

Mesmo ferramentas de IA jurídica "grounded" ou aumentadas por recuperação (RAG) podem produzir citações alucinadas colocadas dentro de citações reais e corretamente formatadas. Este modo de falha é mais perigoso do que um caso obviamente falso porque a citação em si é genuína, então passa por uma verificação de citação de rotina enquanto a linguagem citada que atribui ao caso nunca foi realmente escrita por aquele tribunal. No caso Mata v. Avianca (2023), advogados foram sancionados após apresentar um parecer com casos totalmente fabricados produzidos pelo ChatGPT. Um estudo de 2024 do Stanford RegLab / HAI descobriu que ferramentas de pesquisa de IA jurídica líderes ainda alucinaram em uma parte substancial das consultas (reportadas na faixa de aproximadamente 17 a 33 por cento, dependendo da ferramenta e da tarefa), apesar do grounding. A auto-verificação de modelo único falha porque o mesmo modelo que fabricou uma citação frequentemente a reafirma quando solicitado a verificar. O desacordo entre modelos cruzados captura o que um único modelo grounded perde: diferentes modelos, baseados em diferentes recuperações, raramente fabricam a mesma citação, então uma citação que apenas um modelo pode produzir é sinalizada. O banco de dados Damien Charlotin rastreia publicamente casos judiciais envolvendo citações alucinadas por IA. Sempre verifique uma citação contra a fonte primária antes de apresentar; o consenso entre modelos independentes sinaliza maior confiança, não prova.

IA Jurídica

Quando a IA Jurídica "Grounded" Ainda Alucina: Citações Fabricadas Dentro de Citações Reais

Equipe Argumentree.AI2026-07-049 min de leitura
TL;DR

A alucinação mais assustadora da IA jurídica não é um caso falso — é uma citação fabricada inserida dentro de uma citação real. A citação existe, então passa na verificação de citação; as palavras citadas nunca estiveram na opinião. A auto-verificação de um único modelo não vai detectar isso. O desacordo entre modelos diferentes vai: modelos independentes baseados em recuperações diferentes raramente inventam a mesma citação.

Todos aprenderam a lição errada com os processos de alucinação da IA. A manchete foi "IA inventa casos falsos." O verdadeiro perigo é mais sutil e difícil de detectar: IA inventando falsas citações dentro de casos que são totalmente reais.

A falha que todos conhecem: casos fabricados

Em Mata v. Avianca (2023), advogados apresentaram um parecer federal citando várias decisões judiciais que simplesmente não existiam. As citações haviam sido geradas pelo ChatGPT, que produziu nomes de casos, números de repórteres e citações com aparência plausível do nada. Quando a parte contrária e o tribunal não conseguiram localizar os casos, os advogados foram sancionados. Tornou-se a história de advertência canônica da IA generativa na prática jurídica — e ensinou a profissão a realizar uma verificação de citações.

Um caso fabricado é, felizmente, fácil de detectar. Você o procura; ele não está lá; você o exclui. Uma única pesquisa expõe a mentira.

A falha que a maioria das pessoas não percebe: citações falsas em citações reais

Agora considere uma variante mais insidiosa. O caso é real. A citação do repórter é correta. O tribunal, o ano, as partes — tudo genuíno. Mas a sentença que a IA atribui a essa opinião, a decisão citada que coloca entre aspas, nunca foi escrita por aquele tribunal. A ferramenta fundamentou sua resposta em um documento real e então fabricou uma linguagem que afirma ter encontrado lá.

Por que isso é pior do que um caso falso

  • A citação é real, então passa por uma verificação de citação de rotina
  • Um revisor confirma que o caso existe e segue em frente — a citação não é verificada.
  • A linguagem fabricada muitas vezes soa como algo que o tribunal diria
  • Pode sobreviver até mesmo em um resumo processual, uma opinião ou um memorando para o cliente.

Esta é a armadilha das ferramentas de IA jurídica "grounded" ou aumentadas por recuperação (RAG). Fundamentar um modelo em documentos fonte reais reduz as chances de um caso totalmente inventado — mas não garante que o modelo cite com precisão o que recuperou. Ele ainda pode parafrasear uma decisão em palavras que o tribunal nunca usou, ou colar uma citação de uma passagem em uma proposição que não apoia.

Esse padrão de citações em citações reais surgiu, segundo relatos, na prática com assistentes de pesquisa comerciais e fundamentados. Em um exemplo relatado envolvendo o CoCounsel da Thomson Reuters' Westlaw — discutido em conexão com um caso referido como U.S. v. Farris — a ferramenta teria produzido citações que não correspondiam à linguagem da autoridade citada, embora a citação subjacente fosse genuína. Apresentamos isso apenas como uma ilustração reportada: não confirmamos de forma independente o nome exato do caso, a citação, o tribunal, o ano ou a decisão, e os leitores devem verificar esses detalhes antes de confiar neles. O padrão, no entanto, está bem documentado — e é o padrão, não qualquer anedota isolada, que deve mudar a forma como você revisa a saída da IA.

A aterragem não é uma garantia — as evidências

Esta não é uma preocupação marginal. Um estudo de 2024 do Stanford RegLab e do Instituto de IA Centrada no Humano (HAI) avaliou as principais ferramentas de pesquisa em IA jurídica projetadas para esse fim — aquelas explicitamente comercializadas como fundamentadas e mitigadas em alucinações — e descobriu que ainda alucinaram em uma parte significativa das consultas.

Sobre essas figuras

O trabalho do Stanford RegLab / HAI (2024) relatou taxas de alucinação para as principais ferramentas de pesquisa em IA jurídica na faixa de aproximadamente 17–33%, dependendo da ferramenta e da tarefa. Citamos a faixa em vez de um único número principal porque os resultados variaram conforme a ferramenta e o tipo de consulta — para porcentagens exatas por ferramenta e metodologia, consulte o artigo principal.

A conclusão não é "essas ferramentas são ruins." É que o ancoramento reduz a alucinação, mas não a elimina, e o resíduo inclui exatamente a variedade perigosa: citações confiantes, bem formatadas e que passam na verificação de citações, mas que estão erradas.

Para um registro público e em andamento de casos reais de tribunal que envolveram citações alucinatórias de IA, o pesquisador Damien Charlotin mantém um banco de dados amplamente citado que rastreia esses incidentes à medida que chegam aos tribunais. É um excelente recurso para ver com que frequência — e quão longe no processo — esses erros se propagam. Apontamos para ele em vez de duplicá-lo.

Por que a auto-verificação de modelo único falha

A solução instintiva é pedir à mesma ferramenta que verifique a si mesma: "Você tem certeza de que essa citação está correta?" Isso raramente ajuda e muitas vezes piora as coisas.

  • O modelo que fabricou a citação não tem memória de verdade de fundo da opinião — pedir para ele "verificar" apenas repete o mesmo padrão de correspondência que produziu o erro.
  • Prompts como "confirme que isto é palavra por palavra" frequentemente retornam um sim confiante — às vezes com um detalhe de apoio recém-hallucinado.
  • A pontuação de confiança de um modelo não se correlaciona com a precisão das cotações, portanto, ele não pode sinalizar automaticamente as arriscadas.

Por que o desacordo entre modelos o captura

Um modelo isolado tem uma recuperação e uma forma de citá-la. Múltiplos modelos independentes cada um recupera e cita por conta própria. Quando você pergunta a vários modelos a mesma questão e um deles produz uma citação que os outros não conseguem reproduzir — ou que os outros classificam explicitamente como não suportada — essa discordância é o sinal de alerta.

O princípio da independência, aplicado a citações

Se um modelo fabrica "o tribunal decidiu X" em um caso real, outros modelos — baseados em sua própria recuperação da mesma opinião — normalmente não reproduzirão essa linguagem exata fabricada. Uma citação que apenas um modelo pode produzir, e que os outros avaliam mal, aparece como uma afirmação de baixo consenso. Você transformou um erro invisível em uma bandeira visível. Isso sinaliza uma citação que vale a pena verificar na fonte primária — é uma tela de maior confiança, não uma prova de precisão.

Uma lista de verificação para pesquisa jurídica assistida por IA

Se você usar ou não uma ferramenta de consenso, nunca arquive saídas de IA não verificadas. No mínimo:

  • Confirme que o caso existe — mas não pare por aí; um verdadeiro citação é onde os erros perigosos se escondem
  • Puxe a fonte primária e leia a linguagem citada em contexto — verifique cada citação palavra por palavra em relação à opinião em si, e não em relação ao resumo da IA.
  • Verifique se a citação apoia a proposição — uma citação real pode ser anexada a uma afirmação que na verdade não apoia
  • Verifique com modelos independentes — uma citação que apenas um modelo produz é um sinal para investigar, não um fato para arquivar.
  • Nunca trate "fundamentado" como "verificado" — RAG diminui as chances de invenção; não remove seu dever de verificar

O consenso entre modelos independentes aumenta sua confiança de que uma citação é real. Isso não prova. A fonte primária ainda é a autoridade — a IA está apenas lá para ajudá-lo a encontrá-la mais rapidamente e para informá-lo onde os modelos discordam.

Perguntas Frequentes

Qual é a falha da IA jurídica que a maioria das pessoas não percebe?

Não é o caso falso que todos conhecem, mas uma citação fabricada escondida dentro de uma citação real — a citação existe e passa por uma verificação de citação, mas as palavras citadas nunca estiveram na opinião.

Por que a verificação automática de um único modelo não detecta uma citação falsa?

Porque a citação é real, a auto-verificação confirma que o caso existe e para por aí; o modelo não tem um registro independente do que a opinião realmente disse.

Por que a comparação entre modelos captura citações fabricadas?

Modelos independentes baseados em diferentes recuperações raramente inventam a mesma citação, então seu desacordo revela a fabricação que um único modelo confirmaria.

Capture a citação fabricada antes que chegue a um arquivo

Verifique a saída da IA jurídica entre modelos independentes. O desacordo sinaliza as citações que valem a pena verificar.