همه از دعاوی مربوط به توهمات هوش مصنوعی درس اشتباهی گرفتند. تیتر این بود "هوش مصنوعی پروندههای جعلی اختراع میکند." خطر واقعی ظریفتر و سختتر از آن است که شناسایی شود: هوش مصنوعی اختراع نقلقولهای جعلی در پروندههایی که کاملاً واقعی هستند.
شکست که همه میدانند: پروندههای ساختگی
در Mata v. Avianca (2023)، وکلا یک یادداشت فدرال ارائه کردند که به چندین تصمیم قضایی اشاره داشت که به سادگی وجود نداشتند. این ارجاعات توسط ChatGPT تولید شده بودند، که نامهای پرونده، شمارههای گزارش و نقل قولهایی با ظاهری قابل قبول از هیچ تولید کرده بود. زمانی که وکلای طرف مقابل و دادگاه نتوانستند پروندهها را پیدا کنند، وکلا مجازات شدند. این موضوع به داستان احتیاطی کلاسیک هوش مصنوعی تولیدی در عمل حقوقی تبدیل شد — و به حرفه یاد داد که یک بررسی ارجاع انجام دهد.
یک پرونده ساختگی، خوشبختانه، به راحتی قابل شناسایی است. شما آن را جستجو میکنید؛ وجود ندارد؛ آن را حذف میکنید. یک جستجوی ساده دروغ را فاش میکند.
شکست که بیشتر مردم از آن غافلند: نقل قولهای جعلی در ارجاعات واقعی
حال به یک نوع بدتر و زیرکانهتر توجه کنید. این مورد واقعی است. ارجاع خبرنگار درست است. دادگاه، سال، طرفین — همه واقعی هستند. اما جملهای که هوش مصنوعی به آن نظر نسبت میدهد، و حکمی که در علامتهای نقل قول قرار داده، هرگز توسط آن دادگاه نوشته نشده است. این ابزار پاسخ خود را بر اساس یک سند واقعی بنا کرده و سپس زبانی را جعل کرده که ادعا میکند آنجا پیدا کرده است.
چرا این بدتر از یک پرونده جعلی است
- •ارجاع واقعی است، بنابراین یک بررسی ارجاع روتین را پشت سر میگذارد
- •یک بازبین تأیید میکند که پرونده وجود دارد و ادامه میدهد — نقل قول تأیید نشده باقی میماند
- •زبان ساختگی اغلب به نظر میرسد مانند چیزی که دادگاه بگوید
- •این میتواند تا یک یادداشت مختصر، یک نظر یا یک یادداشت مشتری ادامه یابد.
این تله ابزارهای هوش مصنوعی حقوقی "زمینی" یا تقویتشده با بازیابی (RAG) است. پایهگذاری یک مدل بر روی اسناد واقعی احتمال وقوع یک پرونده کاملاً اختراعی را کاهش میدهد — اما ضمانت نمیکند که مدل بهدرستی آنچه را که بازیابی کرده است نقل قول کند. هنوز هم میتواند یک حکم را به کلماتی که دادگاه هرگز استفاده نکرده است، پارافرایز کند یا یک نقل قول را از یک بخش به یک گزارهای که از آن حمایت نمیکند، متصل کند.
این الگوی نقل قول در ارجاعات واقعی به طور گزارش شدهای در عمل با دستیاران تحقیق تجاری و مبتنی بر واقعیت ظاهر شده است. در یک مثال گزارش شده که شامل CoCounsel Westlaw شرکت Thomson Reuters است — که در ارتباط با موضوعی به نام U.S. v. Farris مورد بحث قرار گرفته — گفته میشود که این ابزار نقل قولهایی تولید کرده است که با زبان مرجع ذکر شده مطابقت نداشت، حتی اگر ارجاع اصلی واقعی بود. ما این را تنها به عنوان یک مثال گزارش شده ارائه میدهیم: ما نام دقیق پرونده، ارجاع، دادگاه، سال یا حکم را به طور مستقل تأیید نکردهایم و خوانندگان باید قبل از اتکا به آن جزئیات را تأیید کنند. با این حال، الگو به خوبی مستند شده است — و این الگو، نه هر داستان تک، باید نحوه بررسی خروجی هوش مصنوعی شما را تغییر دهد.
زمینگیری تضمینی نیست — شواهد
این یک نگرانی حاشیهای نیست. یک مطالعه 2024 از RegLab استنفورد و موسسه هوش مصنوعی انسانمحور (HAI) ابزارهای تحقیقاتی حقوقی مبتنی بر هوش مصنوعی را که به طور خاص به عنوان ابزارهایی با پایه و کاهش توهم بازاریابی شدهاند، ارزیابی کرد و دریافت که هنوز هم در بخشی معنادار از پرسشها توهم ایجاد میکنند.
درباره این اعداد
گزارش کار Stanford RegLab / HAI (2024) نرخهای توهم را برای ابزارهای پیشرو در تحقیق حقوقی-هوش مصنوعی در حدود 17–33% اعلام کرد، بسته به ابزار و وظیفه. ما به این دامنه اشاره میکنیم نه به یک عدد سرخطی واحد زیرا نتایج بسته به ابزار و نوع پرسش متفاوت بود — برای درصدهای دقیق هر ابزار و روششناسی، به مقاله اصلی مراجعه کنید.
نتیجهگیری این نیست که "این ابزارها بد هستند." بلکه این است که پایهگذاری توهم را کاهش میدهد اما آن را از بین نمیبرد و باقیمانده شامل دقیقاً نوع خطرناک آن است: نقلقولهای مطمئن، بهخوبی قالببندیشده و با ارجاعات صحیح که نادرست هستند.
برای یک رکورد عمومی و جاری از پروندههای واقعی دادگاه که شامل ارجاعات توهمی هوش مصنوعی بودهاند، محقق دامین شارلتین یک پایگاه داده با ارجاعهای گسترده را حفظ میکند که این حوادث را در حین رسیدن به دادگاهها پیگیری میکند. این منبع عالی برای مشاهده این است که این خطاها چقدر اغلب و تا چه مرحلهای از فرآیند پیش میروند. ما به آن اشاره میکنیم به جای اینکه آن را تکرار کنیم.
چرا تأیید خودکار مدل تکگانه شکست میخورد
راه حل غریزی این است که از همان ابزار بخواهید خود را بررسی کند: "آیا مطمئن هستید که این نقل قول دقیق است؟" این به ندرت کمک میکند و اغلب اوضاع را بدتر میکند.
- مدلی که نقل قول را ساخته است، هیچ حافظهای از حقیقت واقعی نظر ندارد — درخواست از آن برای "تأیید" فقط همان الگوی تطبیق را که خطا را تولید کرده است، دوباره اجرا میکند.
- پیشنهاداتی مانند "تأیید کنید که این عیناً درست است" اغلب با یک بله مطمئن بازمیگردند — گاهی اوقات با یک جزئیات حمایتی تازه خیالی
- امتیاز اعتماد یک مدل با دقت نقل قول همبستگی ندارد، بنابراین نمیتواند موارد پرخطر را خود به خود شناسایی کند.
چرا عدم توافق بین مدلها آن را جلب میکند
یک مدل مستقل تنها یک بازیابی و یک روش برای نقل قول دارد. مدلهای مستقل متعدد هر کدام به طور مستقل بازیابی و نقل قول میکنند. وقتی از چندین مدل همان سوال را بپرسید و یکی از آنها یک نقل قول تولید کند که دیگران نمیتوانند آن را بازتولید کنند — یا اینکه دیگران به وضوح آن را به عنوان غیرمستند ارزیابی کنند — آن اختلاف زنگ خطر است.
اصل استقلال، که به نقل قولها اعمال میشود
اگر یک مدل عبارت "دادگاه X را اعلام کرد" را در یک مورد واقعی جعل کند، مدلهای دیگر — که بر اساس بازیابی خود از همان نظر عمل میکنند — معمولاً آن زبان جعل شده دقیق را بازتولید نخواهند کرد. یک نقل قول که تنها یک مدل میتواند تولید کند و دیگران آن را به طور ضعیف ارزیابی میکنند، به عنوان یک ادعای کماجماع ظاهر میشود. شما یک خطای نامرئی را به یک پرچم قابل مشاهده تبدیل کردهاید. این نشاندهنده یک نقل قول است که ارزش بررسی در برابر منبع اصلی را دارد — این یک فیلتر با اعتماد بالاتر است، نه مدرکی از دقت.
چک لیست تأیید برای تحقیق حقوقی با کمک هوش مصنوعی
چه از ابزار توافق استفاده کنید و چه نه، هرگز خروجی تأیید نشده AI را ثبت نکنید. حداقل:
- تأیید کنید که پرونده وجود دارد — اما در اینجا متوقف نشوید؛ یک ارجاع واقعی جایی است که خطاهای خطرناک پنهان شدهاند
- منبع اصلی را بکشید و زبان نقل شده را در زمینه بخوانید — هر نقل قول را به صورت عین به عین با خود نظر تأیید کنید، نه با خلاصه هوش مصنوعی.
- بررسی کنید که نقل قول از پیشنهاد حمایت میکند — یک نقل قول واقعی میتواند به ادعایی متصل شود که در واقع از آن حمایت نمیکند
- بررسی متقابل با مدلهای مستقل — یک نقل قول که تنها یک مدل تولید میکند، نشانهای برای تحقیق است، نه یک واقعیت برای ثبت.
- هرگز "مستقر" را به عنوان "تأیید شده" در نظر نگیرید — RAG شانس اختراع را کاهش میدهد؛ این به معنای حذف وظیفه شما برای بررسی نیست
توافق در میان مدلهای مستقل اعتماد شما را به واقعی بودن یک نقل قول افزایش میدهد. اما این به معنای اثبات آن نیست. منبع اصلی هنوز هم مرجع است — هوش مصنوعی تنها برای کمک به شما در یافتن سریعتر آن و نشان دادن جایی که مدلها با هم اختلاف دارند، وجود دارد.
سوالات متداول
شکست قانونی-هوش مصنوعی که بیشتر مردم از آن غافلند چیست؟
نه آن پرونده جعلی که همه دربارهاش میدانند، بلکه یک نقل قول ساختگی که درون یک ارجاع واقعی پنهان شده است — ارجاع وجود دارد و از بررسی ارجاع عبور میکند، اما کلمات نقل شده هرگز در نظر وجود نداشتند.
چرا خودکنترل مدل تکگانه نمیتواند یک نقل قول جعلی را شناسایی کند؟
زیرا ارجاع واقعی است، خودتأیید وجود پرونده را تأیید میکند و در آنجا متوقف میشود؛ مدل هیچ رکورد مستقلی از آنچه که نظر واقعاً گفته است، ندارد.
چرا مقایسه بین مدلها نقلقولهای ساختگی را شناسایی میکند؟
مدلهای مستقل که بر اساس بازیابیهای مختلف ساخته شدهاند به ندرت همان نقل قول را اختراع میکنند، بنابراین اختلاف آنها جعل را که یک مدل واحد تأیید میکند، نمایان میسازد.