Benchmark ya wazi

Imepimwa kwenye kazi halisi za memory kwa vipimo viwili

Tunapima Engram kwa njia mbili: kama inapata evidence sahihi, na kama LLM inaweza kujibu kwa usahihi kutoka kwenye context hiyo.

Tunatenganisha evidence retrieval na usahihi wa jibu. Zote zinatumia LoCoMo ya wazi, lakini hupima sehemu tofauti za memory loop.

1,536
maswali yaliyopimwa ya evidence retrieval
92.19%
Engram R@50
66.33%
usahihi wa jibu kutoka top-50 context
+8.21pp
faida ya R@50 dhidi ya LangMem

Utafutaji wa ushahidi wa LoCoMo

Run kamili ya wazi. Scores zinaonyesha kama source evidence inayohitajika ipo ndani ya memories zilizorejeshwa.

+8.21pp juu ya R@50 ya piliN=1,536
MfumoMRRR@1R@50R@200
Engram0.534540.63%92.19%97.66%
LangMem / LangGraph0.400228.32%83.98%94.53%
Mem0 OSS0.399928.32%83.92%94.27%
AgentMemory0.427033.20%79.10%84.96%
BM250.467634.57%78.19%85.74%

Ukaguzi wa majibu wa LoCoMo

Uchunguzi wa Codex/self-review kwenye kazi zilezile 98. Hupima kama jibu lililotengenezwa kutoka context iliyorejeshwa ni sahihi.

N=98
MfumoJibu top-50Jibu top-200dhidi ya modeli ya msingi
Engram66.33%59.18%+56.13pp
Session-file BM2561.22%53.06%+51.02pp
Mem0 OSS55.10%57.14%+44.90pp
BM2548.98%44.90%+38.78pp
LangMem / LangGraph46.94%52.04%+36.74pp
No memory10.20%9.18%baseline
?

Jinsi ya kusoma R@200 na Top-200

Evidence retrieval ni cumulative: R@200 inaweza kujumuisha yote ya R@50 pamoja na zaidi, kwa hiyo haipaswi kuwa chini. Answer accuracy ni tofauti. Context nyingi inaweza kuongeza noise au memories zinazopingana; Top-50 wakati mwingine hujibu kwa usafi zaidi, huku Top-200 ikipima kama packaging bado inasaidia evidence inapoongezeka.

Msaada na maoni

Tusaidie kuboresha Engram

Kama setup inachanganya, tool inafanya ajabu, au pricing limit inaonekana si sahihi, tuma hapa. Message inafika moja kwa moja kwetu.

Msaada na maoni

Tuboreshaje?

Bugs, setup steps zinazochanganya, pricing questions, na product ideas zinaenda moja kwa moja kwa Engram team.

Herufi 10 zaidi zinahitajika0/10