OpenAI도 외부 AI 안전 평가자에게 직원급 접근권을 주겠다고 했어. TNW가 Sam Altman의 발언을 이렇게 전했어. Anthropic CEO Dario Amodei의 에세이 「We Must Pace the Frontier」에 대한 답변으로 보도한 거야.
Altman이 쓴 내용
이후 9월 14일 나온 CNBC 보도도 아래 두 발언을 인용했어. 9월 13일 당시 보도가 아니라, 나중에 나온 보조 근거야.
- 동의: 최전선 모델이 발전하는 속도를 조절해야 한다는 Amodei 주장에 동의한다고 했어
- 약속: 직원과 비슷한 접근권을 가진 독립 평가자를 두는 건 좋은 생각이고, OpenAI도 그렇게 하겠다고 했어
확인한 보도에는 OpenAI의 평가 기관 이름, 시작 시점, 세부 접근 범위가 없어. X 원문은 직접 확보하지 못했어.
Anthropic이 먼저 내건 조건
Amodei는 AI 모델 능력이 좋아지는 속도를 늦춰야 한다고 썼어. 학습이나 기술 발전을 멈추자는 게 아니라, 정렬과 안전장치에 시간을 들이고 제3자 평가자가 그걸 확인할 시간을 두자는 게 본인 설명이야. 에세이가 내놓은 3단계 중 첫 단계가 상주 외부 평가자고, Anthropic은 이걸 혼자서라도 지금 시작한다고 했어. 조건은 이래.
- 자리: Anthropic 사무실 책상, 출입 배지, 회사 노트북
- 권한: 내부 위험 평가팀과 대체로 비슷한 작업 공간과 도구. 법이나 계약, 고객 정보 보호가 걸린 곳은 예외야
- 공개: 위험 수준, 사고, 접근을 실제로 받았는지까지 Anthropic 편집 없이 공개할 수 있어. 보안 정보 같은 좁은 범위만 가릴 수 있고, 불리하다는 이유로는 못 가려
두 회사가 맞춘 건 1단계뿐이야
TNW 정리대로 두 회사가 하루 안에 같은 약속을 공개했지만, 그건 3단계 중 첫 단계까지야. 두 번째 단계는 업계 전체 조정이 필요하다고 Amodei 스스로 적었어. 확보한 TNW·CNBC 보도에서 두 회사가 함께 약속한 것으로 확인되는 건 첫 단계야. 이 보도만으로 두 번째 단계의 참여 여부까지 판단할 수는 없어.
모델 도입을 정하는 팀이라면
OpenAI 세부 조건이 나오면 Anthropic이 공개한 세 가지 조건과 나란히 놓고 보면 돼. 평가자가 결과를 회사 편집 없이 공개할 수 있는지가 이 약속이 실제로 돌아가는지 가늠하는 기준이야. 확인한 건 보도된 약속까지라서, 시행 여부는 따로 확인해야 해.