공개 벤치마크

Engram 벤치마크 방법론

공개 결과의 근거가 되는 데이터셋, 검색 지표, 답변 평가, 기준선, 한계와 주장 규칙을 확인하세요.

LoCoMo 근거 검색92.19%
LoCoMo 답변 평가66.33%
작동 방식
01

LoCoMo 근거 검색

전체 공개 실행입니다. 필요한 원문 근거가 검색된 메모리에 포함되는지 보여줍니다.

02

LoCoMo 답변 평가

같은 98개 작업에서 Codex/self-review로 진단했습니다. 검색된 문맥에서 생성한 답이 맞는지 평가합니다.

03

R@200과 Top-200 읽는 법

증거 검색은 누적 지표입니다. R@200은 R@50이 찾은 것에 더 많은 증거를 포함하므로 낮아지면 안 됩니다. 답변 정확도는 다릅니다. 더 많은 context는 noise나 충돌하는 memory를 함께 가져올 수 있습니다. Top-50은 더 깔끔한 답을 줄 수 있고, Top-200은 더 많은 증거에서도 packaging이 유용한지 봅니다.

1,536

채점된 근거 검색 질문

92.19%

Engram R@50

66.33%

top-50 문맥 답변 정확도

근거 검색과 답변 정확도는 분리해서 보여줍니다. 둘 다 공개 LoCoMo를 쓰지만 메모리 루프의 다른 단계를 봅니다.

LoCoMo ↗

Engram은 올바른 근거를 찾는지, 그리고 그 문맥으로 LLM이 올바르게 답하는지를 따로 측정합니다.

근거 검색과 답변 정확도는 분리해서 보여줍니다. 둘 다 공개 LoCoMo를 쓰지만 메모리 루프의 다른 단계를 봅니다.

지원 및 피드백

Engram 개선에 의견 보내기

setup이 헷갈리거나 tool이 이상하게 동작하거나 pricing limit가 잘못된 것 같으면 여기로 보내세요. 메시지는 바로 우리에게 옵니다.

지원 및 피드백

무엇을 개선할까요?

Bugs, confusing setup steps, pricing questions, product ideas가 Engram team으로 바로 전달됩니다.

10자 더 필요합니다0/10