내 업무에 AI를 맡기기 전에: 로컬 모델 실험에서 배운 평가 설계
내 업무에 AI를 맡기기 전에, 합격 조건부터 정해보세요
요약·회의록·에이전트를 업무에 쓰거나 팀의 AI 도입을 준비하는 실무자를 위한 평가 설계 안내입니다.
오늘의 요약
같은 입력과 사전에 정한 기준으로 비교하면, 어떤 업무를 맡길 수 있고 어디에 사람의 검토가 필요한지 판단할 근거가 생깁니다.
회의록에서 담당자와 마감일을 뽑는 AI가 세 번 중 한 번 날짜를 빠뜨린다면 “대체로 잘한다”는 평가만으로 업무에 맡기기 어렵다. 작은 누락도 후속 연락이나 지원 대상자에게 영향을 준다. 모델을 고를 때 확인해야 할 질문은 구체적이다. 내 업무를 어느 범위까지 맡길 수 있는가.
세미나에서 접한 foundby의 공개 평가는 이 질문을 실제 과제로 바꾸는 방법을 보여준다. 2026년 9월 14일 공개 자료에서 눈여겨볼 부분은 모델 순위보다 평가 설계다. 아래 수치와 결과는 foundby의 실험이며 Sociai 편집부가 재현한 결과는 아니다.
내가 맡길 일을 시험 문제로 만든다
foundby는 실제 업무 55종을 다섯 업무군과 14개 범주로 나눴다. 일정 충돌 확인, 회의록에서 할 일 추출, JSON 형식 지키기, 숨은 지시 무시하기, 고객 정보 최소화하기처럼 결과를 확인할 수 있는 과제들이다. 프롬프트와 통과 조건도 테스트 케이스 페이지에 공개했다.
“회의록을 잘 요약한다”는 기준은 모호하다. “결정 사항, 담당자, 마감일을 표로 만들고, 정해지지 않은 날짜는 지어내지 않는다”라고 쓰면 합격 여부를 확인할 수 있다. 상담 기록이라면 개인정보를 빼는지, 지원사업 공고라면 마감일과 자격 조건을 바꾸어 적지 않는지가 필수 조건이다.
답의 품질과 일을 끝내는 능력을 나눠 본다
평가 방법을 보면 계산 가능한 조건은 코드로, 문맥을 읽어야 하는 조건은 별도의 AI로 확인한다. 필수 조건을 모두 만족해야 통과한다. 같은 과제를 기본 세 번 실행하고, 결과가 2대 1로 갈리거나 오류가 난 경우 등에 한해 보충한다.
“좋은 답”과 “끝까지 실행된 답”도 분리했다. 시간 초과처럼 최종 답을 만들지 못한 실행은 완료된 답의 품질 비율에 섞지 않고 실행 안정성에 따로 기록한다. 정확해도 자주 멈추면 자동화할 수 없고, 매번 완료돼도 날짜가 틀리면 사용할 수 없다.
세 번은 이 실험의 기본 반복 수이며 작은 탐색을 시작하는 예시다. 세 번 모두 성공했다고 100번에도 성공한다고 말할 수 없다. “3회 통과”와 함께 날짜, 입력 조건, 실패를 남기고 실제 업무에서 표본을 더 쌓아야 한다.
AI가 매긴 점수도 다시 확인한다
자동 채점기는 평가 비용을 줄이지만 정답 기계는 아니다. foundby의 실제 운영 사례에서는 오류가 들어 있는 답변에 로컬 모델이 종합 1.0을 줬다. 반대로 사용자가 세션 종료를 요청했고 AI가 완료 사항과 남은 일을 정리해 인계했는데도, “실제 작업을 하지 않았다”며 종합 0.0을 준 사례도 있었다.
형식이 맞는 결과가 올바른 판정이라는 보장은 없다. 결과 저장, 기준 적용, 사람의 해석과 일치 여부는 서로 다른 검사다. 사람이 일부 결과를 다시 읽고, 자동 채점이 놓치는 반례를 기준에 추가해야 한다.
실제 업무 흐름에서 속도를 잰다
입력의 앞부분 계산을 재사용하는 APC 기능을 검증한 사례도 평가 조건의 중요성을 보여준다. MLX-VLM 0.7.0 환경에서 실제 작업 8개의 완료 시간 중앙값은 같은 요청을 즉시 반복할 때 10.7초에서 3.9초로 줄었다. 검사는 요청 10개를 기능 켬과 끔 조건에서 각각 세 번씩, 조건별 30회 수행했고 모두 정상 완료됐다.
그러나 첫 요청은 두 조건 모두 12.0초였고, 다른 사례를 처리한 뒤 돌아오면 10.4초와 10.8초로 이득이 없었다. 같은 문서를 바로 다시 평가할 때만 효과를 확인했다. 조건과 순서를 뺀 숫자는 잘못된 결론을 만든다. APC 재검증 기록에 상세 조건이 있다.
오늘 만들 수 있는 업무 평가표
반복 업무 하나를 고른 뒤 다음 다섯 질문에 답해 보자.
- AI가 읽을 입력과 만들어야 할 결과는 무엇인가?
- 반드시 맞아야 하는 값과 절대 해서는 안 되는 행동은 무엇인가?
- 답변 품질, 실행 완료 여부, 대기 시간을 각각 어떻게 기록할 것인가?
- 같은 조건에서 세 번 실행했을 때 실패가 반복되는가?
- 자동 채점 결과 가운데 사람이 다시 확인할 표본은 무엇인가?
평가표는 AI 업무 평가 설계 가이드를 따라 입력·출력·검토 단계로 나눠볼 수 있다. 원본 응답과 오류를 남기는 방법은 하네스 평가 실전 가이드로 이어진다. 팀과 함께 만들려면 90분 AI 평가 설계 워크숍의 진행자 교안과 평가표를 활용할 수 있다.
좋은 평가는 어떤 업무를 맡길 수 있고 어디에서 사람이 확인해야 하는지 설명한다. 그래야 새 모델도 우리 업무의 기록으로 판단할 수 있다.
이어서 볼 것
이 글을 읽은 뒤 바로 이어볼 수 있는 추천
더 읽기로 감을 넓히고, 사례를 본 뒤, 필요하면 참여나 도구로 넘어가면 됩니다.
다음 행동
아직 댓글이 없습니다. 첫 댓글을 작성해보세요!