업무 에이전트 채점표 설계: 결재 기준 위아래 경로까지 확인하기

OpenAI·Ironclad 연구 협업의 평가 방식을 바탕으로 업무 에이전트 시범 운영 채점표를 과제별 기준과 결재 기준 위아래 경로로 설계하는 방법을 정리했습니다.

가로로 놓인 기준선 위아래로 경로 2개가 이어지고 옆에 체크 표시가 있는 점검표가 놓인 Agent 블로그 표지

1. 이번 발표가 다루는 범위

업무 에이전트를 시범 운영하면 "설정을 마쳤습니다"라는 보고를 받고도 그 결과를 믿어도 되는지 판단하기 어렵습니다. OpenAI는 2026년 10월 6일 계약 업무 플랫폼 Ironclad와 진행한 컴퓨터 사용 연구 협업을 공개하면서, 에이전트가 끝낸 과제를 어떤 기준으로 채점했는지 설명했습니다. 컴퓨터 사용은 에이전트가 화면을 보고 클릭과 입력으로 소프트웨어를 직접 다루는 방식을 말합니다. 이 글에서는 그 평가 방식을 우리 팀의 시범 운영 채점표로 옮기는 방법을 다룹니다.

먼저 이번 발표의 성격을 짚겠습니다. OpenAI가 공개한 것은 연구 협업 소개이고, 원문에는 새 기능 출시나 요금·제공 지역 변경 안내가 없습니다. 연구에 쓴 GPT-6 Astra는 OpenAI가 앞서 출시한 모델입니다. OpenAI는 이 글에서 소수의 소프트웨어 회사를 대상으로 연구 협업 신청을 받는다고 밝혔고, 신청 양식도 함께 공개했습니다.

원문 각주에 따르면 학습용 합성 과제는 미국 증권거래위원회 공시 시스템(SEC EDGAR)에 공개된 계약서에서 개인정보를 걸러 낸 뒤 만들었습니다. OpenAI는 학습과 평가에 OpenAI 고객 데이터, OpenAI 내부 계약서, 비공개 Ironclad 고객 데이터·계약서를 쓰지 않았다고 밝혔습니다.

2. 과제마다 채점 기준 개수를 다르게 정했습니다

OpenAI는 원문에서 "We evaluated each task against 8 to 50 criteria, depending on its complexity."라고 밝혔습니다. 과제 복잡도에 따라 과제 1건을 8개에서 50개 기준으로 채점했다는 뜻입니다. 연구 과제는 11개이고, 숙련 사용자가 처리하면 과제마다 30분에서 40분쯤 걸린다고 OpenAI는 추정했습니다. 11개 과제의 전체 목록과 기준 문항은 공개되지 않았고 원문에는 예시 일부만 실렸습니다.

OpenAI는 이렇게 채점해서 모델이 과제의 어느 부분을 맞혔고 어디서 부족했는지 볼 수 있었다고 설명했습니다. 결과를 성공과 실패 한 칸으로만 적으면 이 차이가 보이지 않습니다. 같은 과제를 다른 모델이나 다른 지시문으로 다시 맡겨 점수를 비교할 때도 세부 기준이 있어야 무엇이 나아졌는지 확인할 수 있습니다. 작성자 판단으로는 기준 개수를 과제 복잡도에 맞춘 점도 참고할 만합니다. 승인자 1명을 지정하는 과제와 부서별 결재선을 여러 단계로 짜는 과제를 같은 개수의 기준으로 채점하면, 복잡한 과제에서 생긴 실수가 점수에 드러나지 않습니다.

3. 결재 기준 금액 위와 아래로 요청을 모두 보내 봅니다

원문이 공개한 기준 예시 가운데 하나는 이렇습니다. "For example, it must configure Finance approval above the spending threshold and check that requests above and below it follow the right paths." 지출 기준 금액을 넘는 요청에는 재무팀 승인을 설정하고, 기준보다 큰 요청과 작은 요청이 각각 맞는 경로로 가는지 확인해야 한다는 내용입니다.

OpenAI는 이어서 "Getting individual steps right is not enough: the finished process must work across the situations it was designed to handle."라고 적었습니다. 단계를 하나하나 맞게 처리하는 것만으로는 부족하고, 완성된 프로세스가 설계한 상황 전체에서 동작해야 한다는 뜻입니다.

그래서 결재 규칙을 화면에 입력한 것만 보고 통과시키면 안 됩니다. 기준 금액 칸에 숫자가 들어갔는지는 설정만 확인한 것이고, 실제 요청이 어느 경로로 가는지는 시험 요청을 보내 봐야 알 수 있습니다. 아래 도식은 이 기준을 예시 결재 흐름에 옮긴 것입니다. 기준 금액과 같은 금액을 넣는 요청 C는 원문에 없는 항목으로 작성자가 추가했습니다. 경계값을 초과로 볼지 이상으로 볼지는 회사 규칙마다 다르기 때문에, 시험 요청에 넣어 두면 설정 실수를 찾기 쉽습니다.

요청 금액 축 가운데에 Finance 결재 기준 금액 선을 긋고, 기준보다 적은 예시 요청 A는 Finance 결재 없이 다음 단계로, 기준보다 큰 예시 요청 B는 Finance 결재를 거쳐 진행, 기준과 같은 예시 요청 C는 규칙 문서에서 포함 여부를 확인하도록 표시한 도식. 아래에는 채점표에 넣을 설정, 경로, 완료 기준이 순서대로 적혀 있다.
기준 금액 위아래 요청의 경로를 확인한다는 기준과, 완성된 프로세스가 설계한 상황 전체에서 동작해야 한다는 조건은 OpenAI 원문에서 옮겼습니다. 요청 A·B·C, 기준 금액과 같은 요청 C, 설정·경로·완료 구분은 작성자가 구성한 예시입니다. 이미지를 열어 확대할 수 있습니다. 화면이 좁으면 도식을 가로로 스크롤해 글자를 확인하세요.

4. 평균 점수와 시간은 회사 자체 연구 결과로 읽습니다

OpenAI 발표에 따르면 11개 연구 과제의 평균 채점 점수는 GPT-6 Astra(Max) 55.0%, GPT-5.6 Sol(High) 41.6%였고, Astra 개발에 쓴 OpenAI 내부 모델은 63.7%였습니다. Max와 High는 각 모델이 가장 높은 점수를 낸 추론 설정입니다. 시도 1회의 평균 시간은 Astra 19.2분, Sol 37.0분으로 추정했습니다. 모두 OpenAI가 자체 연구 과제로 측정한 결과입니다.

수치를 읽을 때는 원문의 단서 2개를 함께 봐야 합니다. OpenAI는 "These results cover the 11 research tasks, not all Ironclad workflows."라고 적어 결과 범위를 11개 연구 과제로 한정했습니다. 시간에 대해서는 "The times are simulated estimates based on assumed model processing and generation speeds, not measured customer time savings."라고 밝혔습니다. 모델 처리 속도와 생성 속도를 가정해 계산한 추정치이므로, 고객 업무에서 줄어든 시간으로 옮겨 쓰면 안 됩니다. 실제 고객 환경에서의 성능도 이번 발표로는 확인할 수 없습니다.

가장 높은 내부 모델 점수도 63.7%입니다. 그래서 작성자는 에이전트가 기준 일부를 놓친다는 전제로 시범 운영을 설계해야 한다고 봅니다. OpenAI도 "This underscores why human oversight still matters as agents get better at complex contracting tasks, and why a full contracting platform remains essential."라고 적어, 에이전트 성능이 좋아져도 사람의 감독과 계약 플랫폼이 계속 필요하다고 밝혔습니다.

항목수치읽을 때 함께 볼 조건
평균 채점 점수, GPT-6 Astra(Max)55.0%11개 연구 과제 평균, OpenAI 자체 평가
평균 채점 점수, GPT-5.6 Sol(High)41.6%같은 11개 연구 과제
평균 채점 점수, Astra 개발에 쓴 OpenAI 내부 모델63.7%같은 11개 연구 과제
시도 1회 평균 추정 시간Astra 19.2분, Sol 37.0분처리·생성 속도를 가정한 시뮬레이션 추정치, 고객 실측 아님
숙련 사용자 과제당 평균 시간약 30분에서 40분OpenAI 추정

5. 이번 주에 우리 팀 채점표 1장을 만들어 보세요

예시로 구매 요청 결재 흐름을 에이전트에게 설정하게 한다고 해 보겠습니다. 기준은 설정, 경로, 완료로 나눠 적으면 빠뜨리는 항목을 줄일 수 있습니다. 설정 기준에는 결재 기준 금액이 규칙 문서와 같은 숫자로 들어갔는지, 재무팀 승인자가 지정됐는지를 적습니다. 경로 기준에는 기준보다 작은 요청이 재무팀 승인 없이 다음 단계로 갔는지, 큰 요청이 재무팀 승인을 거쳤는지, 같은 금액 요청이 규칙대로 처리됐는지를 적습니다. 완료 기준에는 요청자가 최종 결과를 받았는지처럼 흐름을 끝까지 따라가야 확인되는 항목을 넣습니다. 여기까지 적으면 기준이 6개이고, 완료 기준을 2개 더 적으면 원문이 밝힌 최소 개수인 8개가 됩니다.

경로 기준은 사람이 시험 요청의 결과 화면을 직접 열어 채점하십시오. 에이전트가 스스로 완료했다고 보고한 내용만으로 점수를 매기면, 원문이 지적한 것처럼 단계는 맞았는데 전체 흐름이 틀린 경우를 놓칠 수 있습니다.

이번 주에는 팀 업무 가운데 금액이나 건수처럼 기준값이 있는 흐름 1건을 골라 보세요. 채점표에 설정·경로·완료 기준을 8개 이상 적고, 기준값보다 작은 요청, 큰 요청, 같은 요청을 1건씩 준비하면 됩니다. 이번 발표에는 제품·요금 변경 안내가 없으므로 지금 쓰는 도구로 시작할 수 있고, 에이전트를 아직 연결하지 않았다면 사람이 만든 설정부터 이 채점표로 채점해 보셔도 됩니다.

확인한 공식 출처

  1. Advancing computer use with Ironclad (OpenAI, 2026년 10월 6일)
  2. Computer-use research collaboration 신청 양식 (OpenAI, Ironclad 발표 본문에서 연결)
  3. GPT-6 Astra: 새로운 세대의 지능 (OpenAI, 2026년 9월 22일 업데이트 표시)