도구가 정답을 준다고 치고 재는 게 문제야

“에이전트 평가는 대개 붙여 놓은 도구가 정답을 준다고 치고 재는데, 실제 현장에서는 그 도구부터 틀려.”

8월 3일 arXiv에 올라온 PredAct-Bench가 그 전제를 걷어낸 벤치마크야. 예측 도구가 일부러 틀리게 답하도록 잡음을 통제해서 넣고, 그 상태에서 대화 에이전트를 평가해.

의사가 진단 예측 도구를 쓰거나 학사 담당자가 성적 예측 모델을 참고하는 상황을 상정한 거야. 도구가 완벽하지 않은 게 기본값인 자리들이지.

시험대로 교육을 고른 이유

  • 정답이 나중에 확인돼: 학생이 실제로 어떤 성적을 받았는지가 남아 있어서 예측이 맞았는지 뒤에 검증돼.
  • 개입 결정이 뚜렷해: 추가 지도를 붙일지 말지처럼 사람이 내리는 결정이 명확히 갈려.
  • 데이터 2종: 영국 개방대학이 2017년에 공개한 OULAD의 실제 평가 기록과, 강의 60개의 실제 최종 성적에 주차별 점수 흐름을 합성해 붙인 PREDACT-CS를 썼어.

믿는 정도까지 숫자로 재

논문이 새로 만든 건 지표 2개야. 상대 AI 의존도(RAIR)는 사용자가 도구 답을 얼마나 따라갔는지, 상대 자기 의존도(RSR)는 자기 판단을 얼마나 지켰는지를 대화 한 편 단위로 재.

한 번의 질문과 답이 아니라 여러 턴이 오간 대화 전체를 놓고 본다는 게 차이야. 사람 대신 LLM만 놓고 재는 게 아니라, 강사와 조교가 참여한 사람 연구도 같이 돌렸어.

13개 모델이 같은 자리에서 걸렸어

도구가 틀렸을 때 모델이 사용자에게 그 불확실성을 드러내 줘야 사용자가 틀린 제안이나 환각에 과하게 기대지 않는데, 평가한 13개 최신 모델이 그걸 못 했다는 게 논문 결론이야.

정답률이 아니라 알려주는 능력에서 걸린 거야. 사내 업무에 에이전트를 붙일 때 이쪽을 따로 보는 팀은 아직 드물어.

옮겨 볼 때 확인할 것

  • 도메인 조건: 시험대는 교육이야. 의료나 금융에서 같은 결과가 나오는지는 이 논문에 없어.
  • 데이터 조건: PREDACT-CS의 주차별 점수 흐름은 합성 데이터야. 최종 성적만 실제 기록이야.
  • 확인 못 한 것: 모델별 점수표가 공개된 본문에서 확인되지 않아, 어떤 모델이 상대적으로 나은지는 아직 말할 수 없어.
  • 바로 해볼 수 있는 것: 쓰고 있는 에이전트에 일부러 틀린 값을 주는 도구를 하나 붙여 보고, 답변이 그 사실을 알려주는지 확인해 보는 것부터 해도 돼.