የህዝብ benchmark
በእውነተኛ memory tasks ላይ ተለክቷል በሁለት መፈተኛዎች
Engramን በሁለት መንገድ እንለካለን፡ ትክክለኛ evidence ያገኛል? LLM ከዚያ context ትክክለኛ መልስ ይሰጣል?
Evidence retrievalን እና answer accuracyን እንለያያለን። ሁለቱም public LoCoMo ይጠቀማሉ፣ ግን የmemory loop የተለያዩ ክፍሎችን ይለካሉ።
1,536
የተመዘኑ evidence-retrieval ጥያቄዎች
93.29%
Engram R@50
89.65%
ከtop-50 context የመልስ ትክክለኛነት
+8.13pp
ከሁለተኛው ምርጥ ስርዓት በላይ R@50 ጥቅም
የLoCoMo ማስረጃ ፍለጋ
ሙሉ public run። Scores የሚያሳዩት የሚፈለገው source evidence በተመለሱ memories ውስጥ እንዳለ ነው።
+8.13pp ከሁለተኛ R@50 በላይN=1,536
| ስርዓት | MRR | R@1 | R@50 | R@200 |
|---|---|---|---|---|
| Engram | 0.5427 | 40.95% | 93.29% | 97.59% |
| Mem0 OSS | 0.4314 | 31.25% | 85.16% | 94.79% |
| LangMem / LangGraph | 0.4006 | 28.39% | 83.98% | 94.53% |
| AgentMemory | 0.4627 | 35.68% | 83.33% | N/A |
| Session-file BM25 | 0.1858 | 9.11% | 81.90% | 95.05% |
| BM25 | 0.4676 | 36.39% | 78.19% | 85.74% |
የLoCoMo መልስ ግምገማ
እያንዳንዱ ረድፍ ማስረጃ ያላቸውን 1,536 ተግባራት በሙሉ እና ተመሳሳይ top-50 ገደብ ይጠቀማል። Codex መልሶቹን ፈጠረ፣ የተለየ ዓይነ ስውር ገምጋሚም ነጥብ ሰጠ። ይህ በEngram የተካሄደ ምርመራ እንጂ ይፋዊ የLoCoMo ደረጃ አይደለም።
| ስርዓት | ትክክል / N | Top-50 መልስ |
|---|---|---|
| Engram | 1,377 / 1,536 | 89.65% |
| Mem0 OSS | 1,294 / 1,536 | 84.24% |
| AgentMemory | 1,280 / 1,536 | 83.33% |
| LangMem / LangGraph | 1,279 / 1,536 | 83.27% |
| Session-file BM25 | 1,235 / 1,536 | 80.40% |
| BM25 | 1,227 / 1,536 | 79.88% |
?
ሁለቱን ሰንጠረዦች እንዴት ማንበብ ይቻላል?
የታተሙት ሁለቱ ግምገማዎች ማስረጃ ያላቸውን 1,536 ተግባራት በሙሉ ይጠቀማሉ። የማስረጃ ፍለጋ የምንጭ መለያዎችን ይፈልጋል፣ እና ለተካተቱት ስርዓቶች ተመሳሳይ የመልስና የዳኝነት ሞዴሎች ይጠቀማሉ። ተመሳሳይ የግምገማ ውል የማያሟሉ ስርዓቶች ከደረጃው ጋር ሳይቀላቀሉ ለብቻቸው ይመዘገባሉ።
ሁለቱን ሰንጠረዦች እንዴት ማንበብ ይቻላል?