تقييم الحجج هو عملية قيام نماذج الذكاء الاصطناعي بتقييم قوة وصلاحية وجودة الحجج التي تولدها نماذج الذكاء الاصطناعي الأخرى. في Argumentree.AI، تولد كل نموذج (GPT، كلود، جمنائي، جروك، بيربلكسيتي، إلخ) الحجج بشكل مستقل، ثم يقيم كل نموذج كل حجة من كل نموذج آخر. يخلق هذا التقييم المتبادل مصفوفة تحقق: الحجج التي تم تقييمها بشكل عالٍ من قبل جميع النماذج تتمتع بتوافق عالٍ؛ الحجج التي تم تقييمها بشكل سيء من قبل نماذج متعددة يتم الإشارة إليها على أنها قد تكون مشكلة. هذا النظام يكتشف الهلاوس والأخطاء المنطقية والمطالبات الضعيفة التي قد تمر دون أن تلاحظها أي نموذج واحد.
يتم تقييم الحجج من قبل نماذج الذكاء الاصطناعي لبعضها البعض. تكتشف تقييمات النماذج المتعددة الأخطاء التي تغفلها التقييمات الذاتية وأدوات النماذج الفردية.
تقييم الحجج يجعل كل نموذج ذكاء اصطناعي يقيم كل حجة من كل نموذج آخر. الحجج ذات التقييم العالي تتمتع بتوافق عالٍ. الحجج ذات التقييم المنخفض يتم الإشارة إليها للمراجعة البشرية.
يتبع نظام تقييم الحجج عملية منظمة تضمن التقييم المستقل:
كل نموذج ذكاء اصطناعي يبني حججًا لسؤال بحث دون رؤية عمل النماذج الأخرى
يتلقى كل نموذج جميع الحجج من جميع النماذج الأخرى ويقيم كل واحدة منها
تقيم النماذج وفقًا لمعايير: الصلاحية المنطقية، دعم الأدلة، الصلة، الاتساق
تُجمع التقييمات الفردية في درجة توافق لكل حجة
تُعلم الحجج ذات التقييم المنخفض للمراجعة البشرية؛ وتكتسب الحجج ذات التقييم العالي الثقة
هل يتدفق التفكير بشكل صحيح؟ هل هناك مغالطات أو عدم تسلسل؟
هل تدعم الأدلة الادعاءات؟ هل الاقتباسات حقيقية وذات صلة؟
هل تعالج الحجة السؤال المطروح فعلاً؟
هل تتناقض الحجة مع نفسها أو تقدم ادعاءات متضاربة؟
تمتلك نماذج الذكاء الاصطناعي المختلفة بيانات تدريب وهياكل ونقاط عمياء مختلفة. عندما يولد GPT هلاوس، لا "ترث" كلود هذا الخطأ - بل يقيم الادعاء بشكل جديد. هذا الاستقلال هو ما يجعل التقييم المتبادل ذا قيمة. يعني اتفاق خمسة نماذج أن خمسة تقييمات مستقلة توصلت إلى نفس الاستنتاج.
GPT، كلود، جمنائي، جروك، بيربلكسيتي—كلها تقيم بعضها البعض
تظهر كل حجة تقييم التوافق الخاص بها
شاهد التقييمات في لمحة في شجرة الحجج
شاهد أي نموذج أعطى أي تقييم، وليس فقط المجاميع
تقييم الحجج هو عندما تقيم نماذج الذكاء الاصطناعي قوة وصلاحية وجودة الحجج التي تولدها نماذج الذكاء الاصطناعي الأخرى. في البحث متعدد النماذج، يقيم كل نموذج كل حجة من كل نموذج آخر، مما ينشئ مصفوفة تحقق متبادل تكشف عن أقوى الحجج وأيها قد تكون إشكالية.
تقيم نماذج الذكاء الاصطناعي الحجج وفقًا لمعايير مثل الصلاحية المنطقية، دعم الأدلة، الصلة بالسؤال، والاتساق الداخلي. يخصص كل نموذج تقييمًا (عادةً من 1-5 أو 1-10) وقد يقدم مبررات لتقييمه. تشكل مجموعات هذه التقييمات درجة التوافق للحجة.
التقييم الذاتي غير موثوق لأن نماذج الذكاء الاصطناعي لا تستطيع اكتشاف هلوساتها الخاصة أو الأخطاء المنطقية. يعمل تقييم النماذج المتقاطعة لأن النماذج المختلفة لديها نقاط عمياء مختلفة—الأخطاء التي يرتكبها نموذج واحد غالبًا ما يتم اكتشافها بواسطة الآخرين. إن استقلالية المقيمين هي ما يجعل النظام يعمل.
يشير التقييم المنخفض من عدة نماذج إلى أن الحجة قد تحتوي على: هلوسة، خطأ منطقي، ادعاء غير مدعوم، أو عدم دقة واقعية. يجب الإشارة إلى الحجج ذات التقييم المنخفض للمراجعة البشرية قبل استخدامها في البحث أو اتخاذ القرار.
لا. تقييم الذكاء الاصطناعي هو أداة فرز تساعد في تحديد أولويات انتباه البشر. من المرجح أن تكون الحجج ذات التوافق العالي صحيحة؛ تحتاج الحجج ذات التوافق المنخفض إلى تحقق بشري. الهدف هو تعزيز الحكم البشري بإشارات جودة مدعومة بالذكاء الاصطناعي، وليس استبداله.
يكتشف تقييم النماذج المتعددة الحجج الضعيفة ويبني الثقة في الحجج القوية.
ابدأ البحث المجاني