에이전트 하나에 고정 검색만으로는 안 됐어

“에이전트마다 따로 기억을 갖게 하고 답을 한 번 되짚게 했더니 MedQA가 93.2%가 됐어.”

의료 질문은 사실 지식만으로 안 풀려. 조건이 겹치면 앞뒤를 재봐야 하고, 비슷한 사례를 떠올려야 할 때도 있고. 그런데 지금 나와 있는 시스템은 에이전트 하나에 고정된 검색을 붙인 구조가 많았어.

arXiv에 8월 19일 올라온 AMR은 그 구조를 다시 짰어. 역할별 에이전트에게 각자 쓰는 메모리를 주고, 답을 낸 뒤 되짚어보는 피드백을 돌리게 했거든.

복잡도를 먼저 재서 흐름을 나눠

들어온 질문의 복잡도를 먼저 판정해. 그 결과에 따라 세 갈래로 흘러.

  • 단독: 한 에이전트가 바로 답해
  • 협업: 여러 전문 역할이 붙어서 같이 풀어
  • 상위 이관: 더 무거운 절차로 올려 보내

여기에 합의 모듈과 윤리 감독 모듈이 붙어서, 나온 추론을 하나로 모으고 출력을 한 번 검토해. 전용 메모리는 앞서 처리한 사례를 다시 꺼내오는 데 쓰이고.

검색을 안 붙인 구성도 90%까지 갔어

구성 요소를 하나씩 빼면서 잰 실험이 재밌어. 메모리도 되짚기도 검색도 없는 기본 구성은 MedQA 80%, MedMCQA 78%였어.

되짚기만 넣으면 82%와 80.4%, 메모리만 넣으면 86%와 82%가 됐고. 그런데 메모리와 되짚기를 같이 넣고 검색은 안 붙인 구성이 90%와 87.4%까지 올라갔어.

물론 셋을 다 넣은 전체 구성이 93.2%와 90.0%로 가장 높아. 다만 검색을 더 붙이는 것보다 기억과 되짚기 구조를 먼저 넣는 게 더 크게 움직였다는 건 남아.

따라 하기 전에 볼 것

  • 객관식 시험 문항이야: MedQA와 MedMCQA는 선다형 문제야. 논문이 비교한 GPT-4는 86.1%와 73.7%, 사람은 87.0%와 90.0%였어. 시험 점수지 진료 판단 능력이 아니야.
  • 연구·교육용이라고 못 박아 뒀어: 저장소 README에 의료기기가 아니고 전문가의 진단이나 치료를 대신할 수 없다고 적혀 있어.
  • 자체 보고 수치야: 측정도 보고도 저자들이 했고, 제3자가 같은 값을 다시 낸 기록은 아직 없어. SMC 2026 채택은 README에 적힌 내용이야.
  • 가져갈 만한 구조: 의료가 아니어도 쓸 수 있는 건 세 가지야. 에이전트마다 따로 기억을 두는 것, 답을 낸 뒤 한 번 되짚게 하는 것, 그리고 쉬운 질문에 무거운 협업 흐름을 안 태우는 것.

코드는 MIT로 열려 있어서 구조만 뜯어보기에도 괜찮아. 사내 QA 봇 정확도가 검색을 더 붙여도 안 오른다면, 여기 구성 요소 실험 표가 참고가 될 거야.