የህዝብ benchmark

በእውነተኛ memory tasks ላይ ተለክቷል በሁለት መፈተኛዎች

Engramን በሁለት መንገድ እንለካለን፡ ትክክለኛ evidence ያገኛል? LLM ከዚያ context ትክክለኛ መልስ ይሰጣል?

Evidence retrievalን እና answer accuracyን እንለያያለን። ሁለቱም public LoCoMo ይጠቀማሉ፣ ግን የmemory loop የተለያዩ ክፍሎችን ይለካሉ።

1,536
የተመዘኑ evidence-retrieval ጥያቄዎች
93.29%
Engram R@50
89.65%
ከtop-50 context የመልስ ትክክለኛነት
+8.13pp
ከሁለተኛው ምርጥ ስርዓት በላይ R@50 ጥቅም

የLoCoMo ማስረጃ ፍለጋ

ሙሉ public run። Scores የሚያሳዩት የሚፈለገው source evidence በተመለሱ memories ውስጥ እንዳለ ነው።

+8.13pp ከሁለተኛ R@50 በላይN=1,536
ስርዓትMRRR@1R@50R@200
Engram0.542740.95%93.29%97.59%
Mem0 OSS0.431431.25%85.16%94.79%
LangMem / LangGraph0.400628.39%83.98%94.53%
AgentMemory0.462735.68%83.33%N/A
Session-file BM250.18589.11%81.90%95.05%
BM250.467636.39%78.19%85.74%

የLoCoMo መልስ ግምገማ

እያንዳንዱ ረድፍ ማስረጃ ያላቸውን 1,536 ተግባራት በሙሉ እና ተመሳሳይ top-50 ገደብ ይጠቀማል። Codex መልሶቹን ፈጠረ፣ የተለየ ዓይነ ስውር ገምጋሚም ነጥብ ሰጠ። ይህ በEngram የተካሄደ ምርመራ እንጂ ይፋዊ የLoCoMo ደረጃ አይደለም።

N=1,536
ስርዓትትክክል / NTop-50 መልስ
Engram1,377 / 1,53689.65%
Mem0 OSS1,294 / 1,53684.24%
AgentMemory1,280 / 1,53683.33%
LangMem / LangGraph1,279 / 1,53683.27%
Session-file BM251,235 / 1,53680.40%
BM251,227 / 1,53679.88%
?

ሁለቱን ሰንጠረዦች እንዴት ማንበብ ይቻላል?

የታተሙት ሁለቱ ግምገማዎች ማስረጃ ያላቸውን 1,536 ተግባራት በሙሉ ይጠቀማሉ። የማስረጃ ፍለጋ የምንጭ መለያዎችን ይፈልጋል፣ እና ለተካተቱት ስርዓቶች ተመሳሳይ የመልስና የዳኝነት ሞዴሎች ይጠቀማሉ። ተመሳሳይ የግምገማ ውል የማያሟሉ ስርዓቶች ከደረጃው ጋር ሳይቀላቀሉ ለብቻቸው ይመዘገባሉ።

ሁለቱን ሰንጠረዦች እንዴት ማንበብ ይቻላል?

ድጋፍ እና አስተያየት

Engramን እንድናሻሽል ይርዱን

Setup ካስቸገረ፣ tool በልዩ ሁኔታ ካሰራ፣ ወይም pricing limit ትክክል ካልመሰለ እዚህ ይጻፉ። Message በቀጥታ ወደ እኛ ይመጣል።

ድጋፍ እና አስተያየት

ምን እናሻሽል?

Bugs, confusing setup steps, pricing questions እና product ideas በቀጥታ ወደ Engram team ይደርሳሉ።

10 ቁምፊዎች ያስፈልጋሉ0/10