كيف تعمل تقنية اكتشاف هلوسة الذكاء الاصطناعي

يعمل اكتشاف الهلوسة في الذكاء الاصطناعي من خلال استجواب نماذج ذكاء اصطناعي مستقلة متعددة بنفس السؤال ومقارنة إجاباتها. عندما تختلف النماذج، فإن ذلك يشير إلى احتمال وجود هلوسة. تتضمن العملية أربع خطوات: التوليد المستقل (كل نموذج يجيب دون رؤية الآخرين)، تقييم متبادل (كل نموذج يقيم حجج كل نموذج آخر)، اكتشاف الاختلاف (المطالبات التي تم تقييمها بشكل سيء من قبل نماذج متعددة يتم الإشارة إليها)، وتسجيل الإجماع (تشير الاتفاقية العالية إلى ثقة أكبر، بينما يشير الاختلاف إلى الحاجة إلى التحقيق). تعمل هذه الطريقة للتحقق عبر النماذج لأن نماذج الذكاء الاصطناعي المختلفة تتخيل بشكل مختلف - لديها بيانات تدريب وهياكل ونقاط قطع معرفية مختلفة. عندما يختلق نموذج ما ادعاءً، فإن النماذج الأخرى عادةً لا ترتكب نفس الخطأ. تعتبر التحقق المتبادل الأكثر قيمة للمطالبات الواقعية، والاستشهادات، والإحصائيات، والتفاصيل الفنية حيث يوجد حقيقة أساسية للتحقق منها.

أبحاث الذكاء الاصطناعي

كيف يعمل اكتشاف هلوسة الذكاء الاصطناعي: النهج عبر النماذج

فريق Argumentree.AI2026-07-048 دقائق قراءة
ملخص

كشف الهلوسة في الذكاء الاصطناعي يستخدم التحقق عبر النماذج: استعلام عدة نماذج ذكاء اصطناعي بشكل مستقل، وجعلها تقيم إجابات بعضها البعض، وإشارة إلى الاختلافات. النماذج المختلفة تتخيل بشكل مختلف، لذا عندما يقوم أحدها بتلفيق معلومات، عادة ما تكتشفها النماذج الأخرى.

يمكن لنماذج الذكاء الاصطناعي أن تصرح بمعلومات خاطئة تمامًا بثقة—ولا يوجد أي إشارة داخلية تدل على أن هناك شيئًا خاطئًا. يُطلق على هذا اسم الهلوسة، وهو أحد أكبر التحديات في البحث المدعوم بالذكاء الاصطناعي.

المشكلة: هراء واثق

عندما تطلب من نموذج ذكاء اصطناعي التحقق من ادعاء، فإنه لا يتحقق من قاعدة بيانات للحقائق. بل يقوم بإنشاء استجابة تبدو معقولة بناءً على الأنماط في بيانات تدريبه. أحيانًا تؤدي تلك الأنماط إلى التزوير:

  • استشهادات مزيفة: أوراق أكاديمية غير موجودة (قضية ماتا ضد أفيانكا تضمنت سوابق قانونية مزيفة)
  • إحصائيات مخترعة: "تظهر الدراسات أن 80% من الخبراء يتفقون..." دون مصدر
  • أخطاء واثقة: تفسيرات تقنية تبدو معقولة ولكنها خاطئة تمامًا

لماذا "هل أنت متأكد؟" لا تعمل

استجابة طبيعية للشك هي أن تطلب من الذكاء الاصطناعي التحقق من نفسه. لكن هذا لا يساعد:

فشل التحقق الذاتي

  • "هل أنت متأكد؟" → غالبًا ما يكرر نفس الخطأ بثقة أكبر
  • "تحقق من هذا" → قد يولد هلوسات داعمة
  • "تحقق من مصادرهم" → يمكن أن يخترع المزيد من الاقتباسات المزيفة
  • درجات الثقة → لا تتوافق مع الدقة

النموذج ليس لديه مرجع حقيقي للتحقق منه. إنه لا يزال يعتمد على مطابقة الأنماط، فقط مع مطالبة تجعله أكثر ثقة في مطابقة أنماطه.

الحل: التحقق المتقاطع للنماذج

تتخيل نماذج الذكاء الاصطناعي المختلفة بشكل مختلف. لديها بيانات تدريب مختلفة، وهياكل مختلفة، ومواعيد قطع معرفة مختلفة. عندما يختلق نموذج واحد ادعاءً، عادةً لا ترتكب النماذج الأخرى نفس الخطأ.

مبدأ الاستقلال

إذا اخترع GPT اقتباسًا، فإن كلود لا "يرث" هذا الخطأ - بل يقيم الادعاء بناءً على تدريبه الخاص. هذه الاستقلالية هي ما يجعل التحقق المتبادل يعمل. إذا اتفقت خمسة نماذج، فهذا يعني أن خمسة أنظمة مستقلة توصلت إلى نفس الاستنتاج.

كيف تعمل تقنية الكشف عبر النماذج

1

توليد مستقل

كل نموذج ذكاء اصطناعي يجيب على نفس السؤال دون رؤية ردود الآخرين

2

التقييم المتبادل

كل نموذج يقيم كل حجة من كل نموذج آخر

3

كشف الخلاف

تُعلَّم المطالبات التي تم تقييمها بشكل سيء من قبل نماذج متعددة.

4

تقييم الإجماع

الاتفاق العالي = ثقة أعلى؛ الاختلاف = التحقيق

متى يجب استخدام كشف الهلوسة

تعتبر التحقق المتقاطع بين النماذج الأكثر قيمة لـ:

  • مطالبات واقعية يجب التحقق منها
  • الاستشهادات والمراجع
  • الإحصائيات والمطالبات الكمية
  • الأحداث التاريخية والتفاصيل الفنية

إنه أقل صلة بالمهام القائمة على الرأي أو الإبداع حيث لا يوجد "حقيقة ثابتة" للتحقق منها.

قيود لفهم

التحقق المتقاطع بين النماذج ليس مثاليًا:

  • التحيزات المشتركة: قد تكون جميع النماذج قد تعلمت نفس الخطأ من بيانات تدريب مشابهة
  • فجوات المعرفة: قد تكون الأحداث الأخيرة خارج حدود تدريب جميع النماذج
  • خبرة المجال: قد تفتقر جميع النماذج إلى المعرفة في المجالات المتخصصة

تقلل توافق النماذج المتعددة من احتمال الخطأ بشكل كبير لكنها لا تلغي الحاجة إلى التحقق البشري في المطالبات ذات المخاطر العالية.

الأسئلة المتكررة

ما هي هلوسة الذكاء الاصطناعي؟

عندما يصرح نموذج بمعلومات خاطئة تمامًا بثقة دون أي إشارة داخلية تدل على أن هناك شيئًا خاطئًا — واحدة من أكبر التحديات في البحث المدعوم بالذكاء الاصطناعي.

لماذا لا يؤدي سؤال نموذج "هل أنت متأكد؟" إلى اكتشاف الهلوسات؟

لأن النموذج الواحد ليس لديه إشارة داخلية موثوقة لخطأه الخاص؛ يمكن أن يؤدي التحقق الذاتي إلى تكرار نفس الخطأ. يقدم المنشور التحقق المتقاطع بين النماذج كحل بدلاً من ذلك.

كيف تعمل آلية اكتشاف الهلوسة عبر النماذج؟

استعلام نماذج متعددة بشكل مستقل، وجعلها تقيم إجابات بعضها البعض، وتحديد الاختلافات. النماذج المختلفة تتخيل بشكل مختلف، لذا عندما يختلق أحدها، عادة ما يكتشفه الآخرون.

التقط الهلوسات قبل أن تكلفك

قم بالتحقق المتبادل لمخرجات الذكاء الاصطناعي عبر عدة نماذج. يكشف الاختلاف عن الأخطاء.