Nakahalina na mga Sipiin sa Loob ng Tunay na mga Sipi: Ang Mapanganib na Pagkabigo ng Legal-AI

Kahit ang mga "grounded" o retrieval-augmented (RAG) na legal-AI na mga tool ay maaaring makabuo ng mga hallucinated na sipi na inilalagay sa loob ng mga tunay, wastong na-format na mga sipi. Ang pagkukulang na ito ay mas mapanganib kaysa sa isang halatang pekeng kaso dahil ang sipi mismo ay tunay, kaya't ito ay pumapasa sa isang karaniwang cite-check habang ang wika na iniuugnay nito sa kaso ay hindi kailanman isinulat ng korte na iyon. Sa Mata v. Avianca (2023), ang mga abogado ay sinanctionan matapos magsumite ng isang brief na may ganap na pekeng mga kaso na ginawa ng ChatGPT. Isang pag-aaral ng 2024 Stanford RegLab / HAI ang natagpuan na ang mga nangungunang layunin na legal-AI research tools ay patuloy na nag-hallucinate sa isang makabuluhang bahagi ng mga query (na iniulat sa humigit-kumulang 17 hanggang 33 porsyento depende sa tool at gawain), sa kabila ng grounding. Ang single-model self-verification ay nabibigo dahil ang parehong modelo na lumikha ng isang sipi ay madalas na muling inuulit ito kapag tinanong na suriin. Ang cross-model disagreement ay nahuhuli ang mga bagay na hindi nakikita ng isang nag-iisang grounded na modelo: ang iba't ibang mga modelo, na grounded sa iba't ibang retrievals, ay bihirang lumikha ng parehong sipi, kaya't ang isang sipi na tanging isang modelo lamang ang makakagawa ay na-flag. Ang Damien Charlotin database ay pampublikong nagtatala ng mga kaso sa korte na kinasasangkutan ang mga AI-hallucinated na sipi. Palaging suriin ang isang sipi laban sa pangunahing pinagmulan bago magsumite; ang pagkakasunduan sa pagitan ng mga independiyenteng modelo ay nagpapahiwatig ng mas mataas na tiwala, hindi katibayan.

Legal na AI

Kapag ang "Grounded" Legal AI ay Patuloy na Naghuhunos: Mga Pinasang Quote sa Loob ng Tunay na Mga Sipi

Argumentree.AI Team2026-07-049 min basahin
TL;DR

Ang pinaka nakakatakot na legal-AI hallucination ay hindi isang pekeng kaso — ito ay isang gawa-gawang quotation na nakatago sa loob ng isang tunay na sipi. Ang sipi ay umiiral, kaya ito ay pumasa sa cite-check; ang mga salitang binanggit ay hindi kailanman nasa opinyon. Ang single-model self-checking ay hindi ito mahuhuli. Ang cross-model disagreement ay mahuhuli ito: ang mga independiyenteng modelo na nakabatay sa iba't ibang retrievals ay bihirang nag-iimbento ng parehong quote.

Lahat ay natutunan ang maling aral mula sa mga demanda sa AI-hallucination. Ang pamagat ay "AI ay nag-imbento ng mga pekeng kaso." Ang tunay na panganib ay mas banayad at mas mahirap mahuli: AI na nag-imbento ng mga pekeng salin sa loob ng mga kasong ganap na totoo.

Ang pagkabigo na alam ng lahat: mga gawa-gawang kaso

Sa Mata v. Avianca (2023), nag-file ang mga abogado ng isang pederal na brief na binanggit ang ilang mga desisyon ng hukuman na talagang hindi umiiral. Ang mga sipi ay nilikha ng ChatGPT, na nag-produce ng mga pangalan ng kaso, mga numero ng reporter, at mga sipi na tila makatotohanan mula sa wala. Nang hindi mahanap ng mga kalaban na abogado at ng hukuman ang mga kaso, pinatawan ng parusa ang mga abogado. Ito ay naging isang kanonikal na kwento ng babala tungkol sa generative AI sa legal na praktis — at itinuro nito sa propesyon na magsagawa ng cite-check.

Ang isang pekeng kaso ay, sa kabutihang palad, madaling mahuli. Tinitingnan mo ito; wala ito; binubura mo ito. Isang simpleng paghahanap ang nagbubunyag ng kasinungalingan.

Ang pagkukulang na madalas hindi napapansin ng karamihan: pekeng sipi sa totoong mga pagsipi

Ngayon isaalang-alang ang isang mas mapanlinlang na variant. Ang kaso ay totoo. Ang sipi ng mamamahayag ay tama. Ang hukuman, ang taon, ang mga partido — lahat ay tunay. Ngunit ang pangungusap na iniuugnay ng AI sa opinyon na iyon, ang nakuhang pahayag na inilalagay nito sa mga panipi, ay hindi kailanman isinulat ng hukuman na iyon. Ang tool ay nag-ugat ng sagot nito sa isang tunay na dokumento at pagkatapos ay nag-imbento ng wika na sinasabi nitong natagpuan doon.

Bakit ito ay mas masahol kaysa sa isang pekeng kaso

  • Ang sipi ay totoo, kaya ito ay dumadaan sa karaniwang pagsusuri ng sipi
  • Isang tagasuri ang nagkukumpirma na umiiral ang kaso at nagpapatuloy — ang sipi ay nananatiling hindi napatunayan
  • Ang pekeng wika ay madalas na tumutunog na parang isang bagay na sasabihin ng hukuman.
  • Maaari itong makaligtas hanggang sa isang naitalang buod, isang opinyon, o isang memo para sa kliyente.

Ito ang bitag ng mga "grounded" o retrieval-augmented (RAG) na legal-AI na mga tool. Ang pag-ground ng isang modelo sa mga tunay na dokumento ng pinagmulan ay nagpapababa sa posibilidad ng isang ganap na imbentong kaso — ngunit hindi ito nagbibigay ng garantiya na tumpak na sinipi ng modelo ang kanyang nakuha. Maaari pa rin nitong i-paraphrase ang isang desisyon sa mga salitang hindi ginamit ng hukuman, o pagsamahin ang isang sipi mula sa isang talata sa isang proposisyon na hindi nito sinusuportahan.

Ang pattern na ito ng mga sipi sa tunay na mga pagsipi ay iniulat na lumitaw sa praktis kasama ang mga komersyal, nakabatay sa pananaliksik na mga katulong. Sa isang iniulat na halimbawa na kinasasangkutan ang Westlaw CoCounsel ng Thomson Reuters — na tinalakay kaugnay ng isang usaping tinawag na U.S. v. Farris — sinasabing nakabuo ang tool ng mga sipi na hindi tumutugma sa wika ng binanggit na awtoridad, kahit na ang batayang pagsipi ay tunay. Ipinapakita namin ito bilang isang iniulat na halimbawa: hindi namin nakumpirma nang nakapag-iisa ang eksaktong pangalan ng kaso, pagsipi, korte, taon, o desisyon, at dapat suriin ng mga mambabasa ang mga detalye bago umasa sa mga ito. Ang pattern, gayunpaman, ay mahusay na naidokumento — at ito ang pattern, hindi ang anumang solong anekdota, na dapat magbago kung paano mo suriin ang output ng AI.

Ang grounding ay hindi isang garantiya — ang ebidensya

Ito ay hindi isang marginal na alalahanin. Isang 2024 na pag-aaral mula sa Stanford RegLab at sa Institute for Human-Centered AI (HAI) ang nag-evaluate ng mga nangungunang legal-AI research tools na partikular na ibinibenta bilang nakabatay at may mitigated na hallucination — at natagpuan nilang patuloy pa rin itong nagkakaroon ng hallucination sa isang makabuluhang bahagi ng mga query.

Tungkol sa mga numerong ito

Ang Stanford RegLab / HAI (2024) na ulat ay nag-ulat ng mga rate ng hallucination para sa mga nangungunang legal-AI research tools sa humigit-kumulang na 17–33% na saklaw, depende sa tool at gawain. Binanggit namin ang saklaw sa halip na isang solong headline na numero dahil nag-iba-iba ang mga resulta batay sa tool at uri ng query — para sa eksaktong porsyento ng bawat tool at metodolohiya, kumonsulta sa pangunahing papel.

Ang takeaway ay hindi "masama ang mga tool na ito." Ito ay ang grounding ay nagpapababa ng hallucination ngunit hindi ito ganap na nawawala, at ang natitirang bahagi ay eksaktong ang mapanganib na uri: tiwala, maayos na naka-format, at pumapasa sa cite-check na mga sipi na mali.

Para sa isang tumatakbo, pampublikong tala ng mga tunay na kaso sa korte na kinasasangkutan ang mga AI-hallucinated na sipi, ang mananaliksik na si Damien Charlotin ay nagpapanatili ng isang malawak na sinipi na database na sumusubaybay sa mga insidenteng ito habang umabot ang mga ito sa mga korte. Ito ay isang mahusay na mapagkukunan para makita kung gaano kadalas — at gaano kalalim sa proseso — naglalakbay ang mga pagkakamaling ito. Itinuturo namin ito sa halip na ulitin ito.

Bakit nabibigo ang self-verification ng isang solong modelo

Ang likas na solusyon ay ang hilingin sa parehong kasangkapan na suriin ang sarili nito: "Sigurado ka bang tama ang sipi na iyon?" Bihirang nakakatulong ito, at madalas pang nagpapalala sa sitwasyon.

  • Ang modelong gumawa ng sipi ay walang totoong alaala ng opinyon — ang paghingi dito na "i-verify" ay muling nagpapatakbo ng parehong pattern-matching na nagdulot ng error.
  • Mga prompt tulad ng "kumpirmahin na ito ay eksakto" ay madalas na nagbabalik ng tiyak na oo — minsan kasama ang isang bagong likhang detalye na sumusuporta.
  • Ang tiwala ng modelo ay hindi tumutugma sa katumpakan ng sipi, kaya hindi nito maitatampok ang mga mapanganib na ito.

Bakit nahuhuli ng hindi pagkakasundo sa cross-model ito

Isang nag-iisang nakatigil na modelo ang may isang retrieval at isang paraan ng pag-quote nito. Maraming independiyenteng modelo ang bawat isa ay nagre-retrieve at nag-quote sa kanilang sarili. Kapag tinanong mo ang ilang modelo ng parehong tanong at isa sa kanila ang nagbigay ng isang quotation na hindi kayang ulitin ng iba — o na tahasang niraranggo ng iba bilang walang suporta — ang hindi pagkakasundong iyon ang alarm bell.

Ang prinsipyo ng kalayaan, na inilapat sa mga sipi

Kung ang isang modelo ay nag-imbento ng "ang korte ay nagpasya ng X" sa isang tunay na kaso, ang ibang mga modelo — na nakabatay sa kanilang sariling pagkuha ng parehong opinyon — ay karaniwang hindi muling gagawin ang eksaktong imbentong wika na iyon. Isang sipi na tanging isang modelo lamang ang makakagawa, at na mababa ang rating ng iba, ay lumilitaw bilang isang claim na may mababang konsensus. Naging nakikita mong error ang isang hindi nakikitang error. Ito ay nag-signals ng isang sipi na dapat suriin laban sa pangunahing pinagmulan — ito ay isang mas mataas na kumpiyansa na screen, hindi patunay ng katumpakan.

Isang listahan ng beripikasyon para sa AI-assisted na pananaliksik sa batas

Kung gagamit ka man ng consensus tool o hindi, huwag kailanman magsumite ng hindi napatunayang output ng AI. Sa pinakamababa:

  • Kumpirmahin na umiiral ang kaso — ngunit huwag tumigil doon; ang tunay na sipi ay kung saan nagtatago ang mga mapanganib na pagkakamali
  • Kunin ang pangunahing pinagkukunan at basahin ang nakasaad na wika sa konteksto — tiyakin ang bawat sipi nang eksakto laban sa opinyon mismo, hindi laban sa buod ng AI
  • Suriin na ang sipi ay sumusuporta sa proposisyon — ang isang tunay na sipi ay maaaring ikabit sa isang pahayag na hindi naman talaga nito sinusuportahan
  • Mag-cross-check sa mga independiyenteng modelo — ang isang sipi na tanging isang modelo lamang ang naglalabas ay isang senyales upang imbestigahan, hindi isang katotohanan na itatago.
  • Huwag kailanman ituring ang "grounded" bilang "verified" — binabawasan ng RAG ang posibilidad ng imbensyon; hindi nito inaalis ang iyong tungkulin na suriin

Ang pagkakasunduan sa mga independiyenteng modelo ay nagpapataas ng iyong tiwala na ang isang sipi ay totoo. Hindi nito pinatutunayan ito. Ang pangunahing pinagmulan pa rin ang awtoridad — ang AI ay narito lamang upang tulungan kang mahanap ito nang mas mabilis at upang sabihin sa iyo kung saan nagkakaiba ang mga modelo.

Mga Madalas Itanong

Ano ang legal-AI na pagkukulang na madalas hindi napapansin ng karamihan?

Hindi ang pekeng kaso na alam ng lahat, kundi isang pekeng sipi na nakatago sa loob ng isang tunay na pagsipi — umiiral ang pagsipi at pumasa sa pagsusuri ng pagsipi, ngunit ang mga salitang sinipi ay hindi kailanman nasa opinyon.

Bakit hindi nahuhuli ng single-model self-checking ang isang pekeng sipi?

Dahil ang sipi ay totoo, ang sariling pag-verify ay nagpapatunay na ang kaso ay umiiral at humihinto doon; ang modelo ay walang independiyenteng tala ng kung ano talaga ang sinabi ng opinyon.

Bakit nahuhuli ng cross-model comparison ang mga pekeng sipi?

Ang mga independiyenteng modelo na nakabatay sa iba't ibang retrieval ay bihirang mag-imbento ng parehong sipi, kaya ang kanilang hindi pagkakasundo ay nagpapakita ng pekeng impormasyon na makukumpirma ng isang solong modelo.

Habulin ang pekeng sipi bago ito umabot sa isang pagsasampa

Suriin ang output ng legal na AI sa iba't ibang independiyenteng modelo. Ang hindi pagkakasundo ay nagmamarka sa mga sipi na dapat beripikahin.