Lahat ay natutunan ang maling aral mula sa mga demanda sa AI-hallucination. Ang pamagat ay "AI ay nag-imbento ng mga pekeng kaso." Ang tunay na panganib ay mas banayad at mas mahirap mahuli: AI na nag-imbento ng mga pekeng salin sa loob ng mga kasong ganap na totoo.
Ang pagkabigo na alam ng lahat: mga gawa-gawang kaso
Sa Mata v. Avianca (2023), nag-file ang mga abogado ng isang pederal na brief na binanggit ang ilang mga desisyon ng hukuman na talagang hindi umiiral. Ang mga sipi ay nilikha ng ChatGPT, na nag-produce ng mga pangalan ng kaso, mga numero ng reporter, at mga sipi na tila makatotohanan mula sa wala. Nang hindi mahanap ng mga kalaban na abogado at ng hukuman ang mga kaso, pinatawan ng parusa ang mga abogado. Ito ay naging isang kanonikal na kwento ng babala tungkol sa generative AI sa legal na praktis — at itinuro nito sa propesyon na magsagawa ng cite-check.
Ang isang pekeng kaso ay, sa kabutihang palad, madaling mahuli. Tinitingnan mo ito; wala ito; binubura mo ito. Isang simpleng paghahanap ang nagbubunyag ng kasinungalingan.
Ang pagkukulang na madalas hindi napapansin ng karamihan: pekeng sipi sa totoong mga pagsipi
Ngayon isaalang-alang ang isang mas mapanlinlang na variant. Ang kaso ay totoo. Ang sipi ng mamamahayag ay tama. Ang hukuman, ang taon, ang mga partido — lahat ay tunay. Ngunit ang pangungusap na iniuugnay ng AI sa opinyon na iyon, ang nakuhang pahayag na inilalagay nito sa mga panipi, ay hindi kailanman isinulat ng hukuman na iyon. Ang tool ay nag-ugat ng sagot nito sa isang tunay na dokumento at pagkatapos ay nag-imbento ng wika na sinasabi nitong natagpuan doon.
Bakit ito ay mas masahol kaysa sa isang pekeng kaso
- •Ang sipi ay totoo, kaya ito ay dumadaan sa karaniwang pagsusuri ng sipi
- •Isang tagasuri ang nagkukumpirma na umiiral ang kaso at nagpapatuloy — ang sipi ay nananatiling hindi napatunayan
- •Ang pekeng wika ay madalas na tumutunog na parang isang bagay na sasabihin ng hukuman.
- •Maaari itong makaligtas hanggang sa isang naitalang buod, isang opinyon, o isang memo para sa kliyente.
Ito ang bitag ng mga "grounded" o retrieval-augmented (RAG) na legal-AI na mga tool. Ang pag-ground ng isang modelo sa mga tunay na dokumento ng pinagmulan ay nagpapababa sa posibilidad ng isang ganap na imbentong kaso — ngunit hindi ito nagbibigay ng garantiya na tumpak na sinipi ng modelo ang kanyang nakuha. Maaari pa rin nitong i-paraphrase ang isang desisyon sa mga salitang hindi ginamit ng hukuman, o pagsamahin ang isang sipi mula sa isang talata sa isang proposisyon na hindi nito sinusuportahan.
Ang pattern na ito ng mga sipi sa tunay na mga pagsipi ay iniulat na lumitaw sa praktis kasama ang mga komersyal, nakabatay sa pananaliksik na mga katulong. Sa isang iniulat na halimbawa na kinasasangkutan ang Westlaw CoCounsel ng Thomson Reuters — na tinalakay kaugnay ng isang usaping tinawag na U.S. v. Farris — sinasabing nakabuo ang tool ng mga sipi na hindi tumutugma sa wika ng binanggit na awtoridad, kahit na ang batayang pagsipi ay tunay. Ipinapakita namin ito bilang isang iniulat na halimbawa: hindi namin nakumpirma nang nakapag-iisa ang eksaktong pangalan ng kaso, pagsipi, korte, taon, o desisyon, at dapat suriin ng mga mambabasa ang mga detalye bago umasa sa mga ito. Ang pattern, gayunpaman, ay mahusay na naidokumento — at ito ang pattern, hindi ang anumang solong anekdota, na dapat magbago kung paano mo suriin ang output ng AI.
Ang grounding ay hindi isang garantiya — ang ebidensya
Ito ay hindi isang marginal na alalahanin. Isang 2024 na pag-aaral mula sa Stanford RegLab at sa Institute for Human-Centered AI (HAI) ang nag-evaluate ng mga nangungunang legal-AI research tools na partikular na ibinibenta bilang nakabatay at may mitigated na hallucination — at natagpuan nilang patuloy pa rin itong nagkakaroon ng hallucination sa isang makabuluhang bahagi ng mga query.
Tungkol sa mga numerong ito
Ang Stanford RegLab / HAI (2024) na ulat ay nag-ulat ng mga rate ng hallucination para sa mga nangungunang legal-AI research tools sa humigit-kumulang na 17–33% na saklaw, depende sa tool at gawain. Binanggit namin ang saklaw sa halip na isang solong headline na numero dahil nag-iba-iba ang mga resulta batay sa tool at uri ng query — para sa eksaktong porsyento ng bawat tool at metodolohiya, kumonsulta sa pangunahing papel.
Ang takeaway ay hindi "masama ang mga tool na ito." Ito ay ang grounding ay nagpapababa ng hallucination ngunit hindi ito ganap na nawawala, at ang natitirang bahagi ay eksaktong ang mapanganib na uri: tiwala, maayos na naka-format, at pumapasa sa cite-check na mga sipi na mali.
Para sa isang tumatakbo, pampublikong tala ng mga tunay na kaso sa korte na kinasasangkutan ang mga AI-hallucinated na sipi, ang mananaliksik na si Damien Charlotin ay nagpapanatili ng isang malawak na sinipi na database na sumusubaybay sa mga insidenteng ito habang umabot ang mga ito sa mga korte. Ito ay isang mahusay na mapagkukunan para makita kung gaano kadalas — at gaano kalalim sa proseso — naglalakbay ang mga pagkakamaling ito. Itinuturo namin ito sa halip na ulitin ito.
Bakit nabibigo ang self-verification ng isang solong modelo
Ang likas na solusyon ay ang hilingin sa parehong kasangkapan na suriin ang sarili nito: "Sigurado ka bang tama ang sipi na iyon?" Bihirang nakakatulong ito, at madalas pang nagpapalala sa sitwasyon.
- Ang modelong gumawa ng sipi ay walang totoong alaala ng opinyon — ang paghingi dito na "i-verify" ay muling nagpapatakbo ng parehong pattern-matching na nagdulot ng error.
- Mga prompt tulad ng "kumpirmahin na ito ay eksakto" ay madalas na nagbabalik ng tiyak na oo — minsan kasama ang isang bagong likhang detalye na sumusuporta.
- Ang tiwala ng modelo ay hindi tumutugma sa katumpakan ng sipi, kaya hindi nito maitatampok ang mga mapanganib na ito.
Bakit nahuhuli ng hindi pagkakasundo sa cross-model ito
Isang nag-iisang nakatigil na modelo ang may isang retrieval at isang paraan ng pag-quote nito. Maraming independiyenteng modelo ang bawat isa ay nagre-retrieve at nag-quote sa kanilang sarili. Kapag tinanong mo ang ilang modelo ng parehong tanong at isa sa kanila ang nagbigay ng isang quotation na hindi kayang ulitin ng iba — o na tahasang niraranggo ng iba bilang walang suporta — ang hindi pagkakasundong iyon ang alarm bell.
Ang prinsipyo ng kalayaan, na inilapat sa mga sipi
Kung ang isang modelo ay nag-imbento ng "ang korte ay nagpasya ng X" sa isang tunay na kaso, ang ibang mga modelo — na nakabatay sa kanilang sariling pagkuha ng parehong opinyon — ay karaniwang hindi muling gagawin ang eksaktong imbentong wika na iyon. Isang sipi na tanging isang modelo lamang ang makakagawa, at na mababa ang rating ng iba, ay lumilitaw bilang isang claim na may mababang konsensus. Naging nakikita mong error ang isang hindi nakikitang error. Ito ay nag-signals ng isang sipi na dapat suriin laban sa pangunahing pinagmulan — ito ay isang mas mataas na kumpiyansa na screen, hindi patunay ng katumpakan.
Isang listahan ng beripikasyon para sa AI-assisted na pananaliksik sa batas
Kung gagamit ka man ng consensus tool o hindi, huwag kailanman magsumite ng hindi napatunayang output ng AI. Sa pinakamababa:
- Kumpirmahin na umiiral ang kaso — ngunit huwag tumigil doon; ang tunay na sipi ay kung saan nagtatago ang mga mapanganib na pagkakamali
- Kunin ang pangunahing pinagkukunan at basahin ang nakasaad na wika sa konteksto — tiyakin ang bawat sipi nang eksakto laban sa opinyon mismo, hindi laban sa buod ng AI
- Suriin na ang sipi ay sumusuporta sa proposisyon — ang isang tunay na sipi ay maaaring ikabit sa isang pahayag na hindi naman talaga nito sinusuportahan
- Mag-cross-check sa mga independiyenteng modelo — ang isang sipi na tanging isang modelo lamang ang naglalabas ay isang senyales upang imbestigahan, hindi isang katotohanan na itatago.
- Huwag kailanman ituring ang "grounded" bilang "verified" — binabawasan ng RAG ang posibilidad ng imbensyon; hindi nito inaalis ang iyong tungkulin na suriin
Ang pagkakasunduan sa mga independiyenteng modelo ay nagpapataas ng iyong tiwala na ang isang sipi ay totoo. Hindi nito pinatutunayan ito. Ang pangunahing pinagmulan pa rin ang awtoridad — ang AI ay narito lamang upang tulungan kang mahanap ito nang mas mabilis at upang sabihin sa iyo kung saan nagkakaiba ang mga modelo.
Mga Madalas Itanong
Ano ang legal-AI na pagkukulang na madalas hindi napapansin ng karamihan?
Hindi ang pekeng kaso na alam ng lahat, kundi isang pekeng sipi na nakatago sa loob ng isang tunay na pagsipi — umiiral ang pagsipi at pumasa sa pagsusuri ng pagsipi, ngunit ang mga salitang sinipi ay hindi kailanman nasa opinyon.
Bakit hindi nahuhuli ng single-model self-checking ang isang pekeng sipi?
Dahil ang sipi ay totoo, ang sariling pag-verify ay nagpapatunay na ang kaso ay umiiral at humihinto doon; ang modelo ay walang independiyenteng tala ng kung ano talaga ang sinabi ng opinyon.
Bakit nahuhuli ng cross-model comparison ang mga pekeng sipi?
Ang mga independiyenteng modelo na nakabatay sa iba't ibang retrieval ay bihirang mag-imbento ng parehong sipi, kaya ang kanilang hindi pagkakasundo ay nagpapakita ng pekeng impormasyon na makukumpirma ng isang solong modelo.