Codos의 Aethos는 왜 EnterpriseRAG-Bench 94%를 말하면서도 아직 완전히 해결됐다고 단정하지 않을까요?
요약 듣기
요약 보기 
이 글의 핵심은 두 가지예요. 하나는 Codos가 만든 메모리 시스템 Aethos X가 약 4만 2천 개 파일 규모에서 EnterpriseRAG-Bench 94%라는 예비 결과를 냈다는 점이고, 다른 하나는 저자들이 이 수치를 곧바로 '문제가 끝났다'는 뜻으로 말하지 않는다는 점이에요. 같은 규모에서 여러 Astra 에이전트를 병렬로 돌린 파일 검색 방식도 86.03%로 꽤 강하게 나왔고, 저자들은 이런 흐름을 근거로 기업용 메모리 문제가 2027년 상반기쯤에는 사실상 해결될 것이라고 전망해요. 다만 이것은 어디까지나 저자들의 예측이고, 지금 공개한 것도 완전한 최종 보고서가 아니라 예비 결과라고 선을 긋고 있어요.
먼저 EnterpriseRAG-Bench가 뭘 재는지 이해해야 숫자가 덜 헷갈려요. 이 벤치마크는 회사 안에서 실제로 쌓일 법한 자료를 흉내 낸 합성 문서 50만 개 이상과 질문 500개로 구성돼 있어요. 슬랙 대화, 이메일, 티켓, 회의록, 코드 리뷰, 위키처럼 서로 성격이 다른 문서들이 섞여 있고, 시스템은 여기서 흩어진 정보를 모으고, 서로 충돌하는 단서를 판단하고, 답에 필요한 조각을 빠짐없이 모으고, 아예 정보가 없을 때는 없다고 알아차려야 해요. 그래서 여기서 말하는 94%는 '관련 문서 94%를 찾았다'는 뜻이 아니라, 답의 정확성과 완전성을 합친 점수에 가까워요. 또 규모를 키울 때는 질문 자체를 바꾸지 않고 주변 문서만 계속 늘려요. 쉽게 말해 같은 질문을 두고 자료 창고만 점점 커지게 만드는 실험이라서, 회사 지식이 불어날수록 길을 잃지 않고 답을 찾는지를 보려는 거예요.
비교표를 볼 때 특히 조심해야 할 부분도 있어요. 겉으로는 여러 시스템이 한 그래프에 같이 놓여 있지만, 전부 같은 조건에서 같은 지점을 직접 측정한 건 아니에요. 일부 리더보드 시스템은 전체 코퍼스 끝점만 공개 측정치가 있고, 더 작은 규모에서의 곡선은 외삽값이에요. Aethos 내부에서도 Balanced의 숫자는 전부 추정치가 섞여 있고, Aethos X는 4만 2천 개 파일 지점의 예비 결과만 제시돼 있어요. Astra도 일부 지점만 실측이고 나머지는 투영치예요. 그러니 이 그래프는 '대충 어떤 흐름인지 보는 맥락'으로는 유용하지만, 모든 선을 그대로 정면 승부의 확정 증거처럼 읽으면 안 된다는 게 저자들의 설명이에요.
그럼 Aethos는 무엇이 다르냐가 중요해져요. 저자 설명에 따르면 Aethos는 회사 문서와 대화에서 작은 사실과 관계를 뽑아내고, 그 사실이 어디서 왔는지 근거와 날짜를 붙여 두고, 같은 사람이나 프로젝트를 가리키는 여러 표현을 맞춰서 연결된 기록으로 유지해요. 새 정보가 들어오면 예전 기록을 덮어써 없애는 게 아니라, 무엇이 어떻게 바뀌었는지 이력을 남기도록 설계됐다고 해요. 에이전트는 질문을 받았을 때 처음부터 문서 더미를 헤집는 대신 이런 연결 구조를 따라가고, 필요할 때만 원문으로 되돌아가 세부를 확인해요. 감으로 비유하면, 질문이 들어온 뒤마다 서류 상자를 처음부터 뒤지는 방식이 아니라, 평소에 사람·프로젝트·결정사항별로 색인 카드와 연결선을 미리 만들어 두는 도서관에 가까워요. 저자들이 '작업의 일부를 질의 시점이 아니라 수집·정리 단계로 옮겼다'고 말하는 이유가 바로 이거예요.
결과를 읽을 때는 성능만이 아니라 시간과 비용의 거래관계도 같이 봐야 해요. 저자들은 이번 연구에서 검색 품질을 최대한 밀어 올리는 쪽으로 세팅했고, 그 대가로 지연시간과 비용이 커졌다고 미리 밝혀요. 실제로 Aethos는 Balanced, Performance, X 세 구성이 있는데, 이름 그대로 품질·속도·비용 사이의 균형점이 달라요. Aethos X는 품질 중심에 아직 공개하지 않은 기술까지 더한 실험 구성이고, 아직 고객에게 제공되지도 않아요. 표에서 X의 정확도는 예비 결과로 제시되지만, 평균 시간과 비용은 아직 비어 있어요. 반대로 Performance나 파일 에이전트 쪽은 시간과 질문당 비용이 함께 공개돼 있어서, '정확도가 1점 더 오를 때 얼마의 대기시간과 예산을 더 써야 하느냐'를 같이 생각하게 만들어요. 저자들이 말하듯, 실시간 비서와 백그라운드 리서치 에이전트는 감당할 수 있는 응답 시간이 다르기 때문에 어떤 구성이 좋은지는 쓰임새에 따라 달라져요.
흥미로운 대목은 Aethos가 좋아 보인다는 사실만큼, 그냥 강한 모델에 병렬 검색을 붙여도 이미 꽤 멀리 간다는 점이에요. 저자들은 Astra 병렬 에이전트가 Aethos 같은 메모리 구조 없이도 86.03%를 냈다고 강조해요. 즉, 오늘날의 강한 모델은 스스로 검색을 꽤 잘 해낸다는 거예요. 하지만 같은 규모에서 Aethos Performance는 90.55%였고, 이 실험에서는 평균 질의 시간과 비용도 Astra보다 낮았다고 해요. 저자들이 여기서 끌어내는 결론은 단순해요. 첫째, 에이전트 자체의 탐색 능력은 이미 상당히 강하다. 둘째, 그래도 올바른 근거를 더 쉽게 찾게 해 주는 메모리 구조의 여지는 남아 있다. 다시 말해 '모델이 좋아지면 메모리 구조는 필요 없다'가 아니라, 둘이 어느 정도 역할을 나눠 갖는 그림에 가까워 보여요.
저자들이 정리한 교훈도 이 연장선에 있어요. 병렬 에이전트는 질문의 부분 문제를 따로 파고들게 해서 답의 누락을 줄여 주지만, 유용한 정보를 이미 찾은 뒤에도 계속 헤매며 비용을 태울 수 있어요. 그래서 언제 멈출지 정하는 규칙이 중요하다고 봐요. 또 작은 코퍼스에서는 단순한 텍스트 검색과 파일 읽기 반복만으로도 버틸 수 있지만, 문서가 많아질수록 그럴듯하지만 틀린 후보들을 솎아내는 일이 훨씬 어려워져요. 이때는 강한 모델만으로 부족하고, 검색 도구와 메모리 구조를 같이 설계해야 한다는 게 저자 주장입니다. 그래프 구조 역시 만능은 아니에요. 흩어진 정보를 연결해 발견성을 높여 주지만, 문서가 늘수록 별칭, 상충하는 진술, 애매한 관계도 함께 늘어나요. 그리고 무엇을 '기억의 기본 단위'로 모델링할지도 아주 큰 결정이에요. 사람, 프로젝트, 약속 같은 것을 따로 기록할지, 어떤 관계를 중요하게 볼지에 따라 나중에 에이전트가 볼 수 있는 세계 자체가 달라져요. 중요한 구분을 처음에 놓치면, 나중 검색 성능도 그 맹점을 그대로 물려받는다는 뜻이에요.
그렇다면 왜 94%를 두고도 저자들이 '이 규모에서의 실효 상한선에 접근했다'고만 말할까요? 이유는 벤치마크 자체에도 오차가 있기 때문이에요. 저자들은 예비 검토에서 질문의 약 2%는 문제 자체에 결함이 있고, 추가로 11%는 평가가 애매하거나 불안정하다고 봤다고 해요. 그래서 이 벤치마크에서 현실적으로 도달 가능한 천장을 약 94% 정도로 추정해요. 예로 든 질문에서는 비밀 정보 회전 절차를 묻는데, 원문 문서에는 정기 회전은 변경 기록에 남기고 긴급 회전은 사고 기록에 남길 수 있다고 돼 있어요. 그런데 기대 정답은 모든 회전을 변경 기록에 남긴다고 적고 있어서, 오히려 문서를 더 충실히 따른 시스템이 채점 키와 충돌할 수 있어요. 이런 사정 때문에 Aethos X의 94%는 '완벽'이 아니라 '현재 저자들이 추정한 천장에 가까움'으로 읽어야 하고, 그 천장 추정 자체도 아직 예비적이라고 이해하는 편이 맞아요.
마지막으로 저자들은 이 연구를 단순한 검색 점수 경쟁보다 더 큰 그림에 연결해요. 기업용 메모리가 2027년 상반기쯤 사실상 해결될 것이라는 자신감은, 한편으로는 강한 에이전트가 이미 검색의 많은 부분을 해내고 있고, 다른 한편으로는 구조화된 메모리가 근거를 찾고 연결하는 방식을 더 낫게 만들고 있다는 방향성에서 나온다고 말해요. 그리고 '자기개선 에이전트'의 바닥에는 이런 메모리가 필요하다고 봐요. 에이전트가 무엇을 시도했는지, 어떤 결정이 바뀌었는지, 어떤 피드백을 받았는지, 그 뒤 무슨 일이 일어났는지를 잊지 않고 남겨야 다음 시도를 더 잘할 수 있기 때문이죠. 다만 이 벤치마크가 검증하는 것은 그 토대의 일부뿐이에요. 저자 스스로도 학습 루프에는 피드백, 평가, 유용한 변화를 유지하는 장치가 추가로 필요하다고 말해요. 그러니 이 글은 '이제 다 끝났다'는 선언이라기보다, 검색 품질은 꽤 높아졌지만 비용, 지연시간, 대규모 확장, 평가 품질 같은 남은 문제가 여전히 중요하다는 중간 보고에 가깝다고 보는 게 맞아요.