معيار عام

مقاس على مهام ذاكرة حقيقية باختبارين

نقيس Engram بطريقتين: هل يسترجع الدليل الصحيح، وهل يستطيع النموذج الإجابة بدقة من ذلك السياق.

نفصل بين استرجاع الأدلة ودقة الإجابة. كلاهما يستخدم LoCoMo العام، لكنهما يقيسان مرحلتين مختلفتين من حلقة الذاكرة.

1,536
أسئلة استرجاع أدلة مقيمة
93.29%
Engram R@50
89.65%
دقة الإجابة من سياق top-50
+8.13pp
تفوق R@50 على ثاني أفضل نظام

استرجاع أدلة LoCoMo

تشغيل عام كامل. توضح الدرجات هل يظهر الدليل المطلوب ضمن الذكريات المسترجعة.

+8.13 نقطة مئوية فوق ثاني أفضل R@50N=1,536
النظامMRRR@1R@50R@200
Engram0.542740.95%93.29%97.59%
Mem0 OSS0.431431.25%85.16%94.79%
LangMem / LangGraph0.400628.39%83.98%94.53%
AgentMemory0.462735.68%83.33%N/A
Session-file BM250.18589.11%81.90%95.05%
BM250.467636.39%78.19%85.74%

تقييم إجابات LoCoMo

يستخدم كل صف المجموعة الكاملة من 1,536 مهمة ذات أدلة وحد top-50 نفسه. أنشأ Codex الإجابات وقيّمها حكم منفصل لا يرى اسم النظام. هذا تشخيص أجرته Engram، وليس ترتيب LoCoMo رسميًا.

N=1,536
النظامصحيح / Nإجابة top-50
Engram1,377 / 1,53689.65%
Mem0 OSS1,294 / 1,53684.24%
AgentMemory1,280 / 1,53683.33%
LangMem / LangGraph1,279 / 1,53683.27%
Session-file BM251,235 / 1,53680.40%
BM251,227 / 1,53679.88%
?

كيف نقرأ الجدولين

يستخدم التقييمان المنشوران جميع المهام ذات الأدلة البالغ عددها 1,536. يتطلب استرجاع الأدلة معرّفات المصدر، وتستخدم جميع الأنظمة المدرجة نماذج الإجابة والتحكيم نفسها. الأنظمة التي لا تحقق عقد التقييم نفسه توثق منفصلة ولا تخلط بالتصنيف.

كيف نقرأ الجدولين

الدعم والملاحظات

ساعدنا في تحسين Engram

إذا كان الإعداد مربكًا، أو تصرفت أداة بشكل غريب، أو بدا حد السعر غير صحيح، اكتب لنا هنا. تصل الرسالة مباشرة إلينا.

الدعم والملاحظات

ما الذي نحسّنه؟

الأخطاء وخطوات الإعداد المربكة وأسئلة الأسعار وأفكار المنتج تصل مباشرة إلى فريق Engram.

باقي 10 أحرف0/10