LoCoMo 근거 검색
전체 공개 실행입니다. 필요한 원문 근거가 검색된 메모리에 포함되는지 보여줍니다.
공개 벤치마크
공개 결과의 근거가 되는 데이터셋, 검색 지표, 답변 평가, 기준선, 한계와 주장 규칙을 확인하세요.
전체 공개 실행입니다. 필요한 원문 근거가 검색된 메모리에 포함되는지 보여줍니다.
같은 98개 작업에서 Codex/self-review로 진단했습니다. 검색된 문맥에서 생성한 답이 맞는지 평가합니다.
증거 검색은 누적 지표입니다. R@200은 R@50이 찾은 것에 더 많은 증거를 포함하므로 낮아지면 안 됩니다. 답변 정확도는 다릅니다. 더 많은 context는 noise나 충돌하는 memory를 함께 가져올 수 있습니다. Top-50은 더 깔끔한 답을 줄 수 있고, Top-200은 더 많은 증거에서도 packaging이 유용한지 봅니다.
채점된 근거 검색 질문
Engram R@50
top-50 문맥 답변 정확도
근거 검색과 답변 정확도는 분리해서 보여줍니다. 둘 다 공개 LoCoMo를 쓰지만 메모리 루프의 다른 단계를 봅니다.
LoCoMo ↗지원 및 피드백
setup이 헷갈리거나 tool이 이상하게 동작하거나 pricing limit가 잘못된 것 같으면 여기로 보내세요. 메시지는 바로 우리에게 옵니다.