업무 자동화

우리 업무에 맞는 AI 평가 설계하기

레시피 L1

반복하는 업무 하나를 골라 통과 조건을 만들고, 같은 입력으로 두 AI 설정의 결과를 비교하는 평가표를 작성해요.

공개일 · 갱신일

이 실습에서 만드는 것

AI에 맡길 업무 하나를 정하고, 어떤 결과가 나와야 쓸 수 있는지 한 장에 적어요. 결과물은 업무 설명, 고정 입력, 통과 조건, 반복 기록, 사용 범위예요. 코드를 몰라도 같은 대화 도구에 준비한 입력을 넣으며 진행할 수 있어요.

이 가이드는 foundby의 공개 평가를 읽고 구성한 교육 자료예요. 아래 회의록은 연습용으로 만든 예시이며 Sociai가 실행해서 얻은 성능 결과가 아니에요. 배경과 설계에서 배울 점은 관련 기사에서 읽을 수 있어요.

1. 반복하는 업무 하나를 작게 골라요

“AI가 일을 잘하는가”보다 “회의록에서 담당자와 마감을 뽑아 업무표로 만들 수 있는가”가 평가하기 좋아요. 누가 결과를 쓰며 틀리면 무엇을 다시 해야 하는지도 적어요. 처음에는 사람이 정답을 확인할 수 있는 작은 업무를 고르세요.

예를 들어 행사 담당자가 회의 뒤 업무표를 만든다고 해 볼게요. 담당자를 잘못 연결하면 엉뚱한 사람에게 일이 배정돼요. 마감이 없는 항목에 날짜를 채워 넣으면 확인되지 않은 약속이 생겨요. 이 두 가지가 우선 확인할 실패예요.

자료는 개인·고객 정보가 없는 연습용으로 준비해요. 긴 문서 전체를 넣기 전에 짧은 사례에서 기대하는 결과부터 정하면 이후에 난도를 높이기도 쉬워요.

2. 필수 조건과 치명적인 실패를 먼저 적어요

다음은 연습용 입력이에요. 모든 비교에서 같은 문장을 사용해요.

9월 15일 행사 준비 회의. 지민은 장소 후보를 9월 18일까지 정리한다. 민수는 안내문 초안을 맡으며 마감은 아직 정하지 않았다. 지난 회의의 다과 주문은 취소한다. 업무, 담당자, 마감 세 열로 표를 만들어라. 정하지 않은 마감은 ‘미정’으로 쓰고, 취소된 업무는 빼라.

정답표에는 장소 후보 정리·지민·9월 18일과 안내문 초안·민수·미정, 두 행이 있어야 해요. 평가 조건은 답변을 보기 전에 정해요.

확인할 것 통과 조건 실패했을 때의 영향
업무와 담당자 두 업무가 각각 맞는 사람과 같은 행에 연결됨 다른 사람에게 업무를 배정할 수 있음
마감 9월 18일과 미정을 정확하게 유지함 확인되지 않은 일정을 약속할 수 있음
취소 반영 다과 주문이 업무표에 없음 취소한 일을 다시 진행할 수 있음
출력 형식 업무·담당자·마감 세 열로 읽을 수 있음 사람이 다시 정리해야 함

이 실습에서는 잘못된 담당자, 지어낸 마감, 취소 업무의 재등장을 치명 실패로 정해요. 글이 매끄러워도 이 조건을 어기면 그대로 사용하지 않아요. 다만 형식 오류와 내용 오류는 따로 기록해 원인을 구별해요.

3. 바꿀 조건 하나와 고정할 조건을 구분해요

현재 쓰는 요청문을 기준 설정, 개선한 요청문을 후보 설정으로 불러요. 요청문을 비교한다면 모델과 입력 자료를 같게 유지해요. 모델을 비교한다면 요청문을 고정해요. 여러 조건을 함께 바꿨다면 결과가 좋아진 이유를 하나로 특정하기 어려워요.

모델명, 날짜, 요청문, 입력 자료를 저장하고 회차마다 새 대화에서 시작해요. 대화 지속성을 평가할 때는 처음부터 정한 순서대로 턴을 이어가며 앞선 실제 답변도 보관해요. M05 사례는 여러 업무를 수정한 뒤 일부 변경만 되돌리게 해, 값과 업무의 연결이 유지되는지 확인해요.

필요한 정보가 없는 과제도 따로 만들어 보세요. 예시에서는 ‘미정’이라고 쓰라는 지시가 있으므로 날짜를 되물을 필요가 없어요. 실제 예약을 요청했는데 날짜가 없다면 확인 질문이 필요할 수 있어요. 질문 수가 적다는 이유만으로 더 좋은 답변이라고 판단하지 않아요.

4. 같은 입력을 각각 반복하고 결과를 나눠 기록해요

첫 탐색은 기준 설정과 후보 설정을 각각 3회 실행해 볼 수 있어요. 입력을 준비한 뒤 기준과 후보의 순서를 번갈아 진행하고, 실패한 회차도 원문 그대로 남겨요. 3회는 흔들리는 지점을 발견하는 시작점이며 신뢰도를 입증하는 표본 수는 아니에요. 같은 입력의 반복만으로 다른 회의록에서도 잘할지 알 수는 없어요.

기록에는 네 칸을 두세요. 응답이 완료됐는지, 표 형식이 맞는지, 필수 내용이 맞는지, 얼마나 걸렸는지예요. 내용은 맞지만 표를 다시 만들어야 하는 답변과, 표는 완벽하지만 담당자가 틀린 답변을 구별할 수 있어요. 재실행했다면 최초 실패와 재시도 결과를 모두 남겨요.

결과에는 성공 횟수와 전체 시도 수를 함께 써요. 오류가 난 회차를 제외했다면 제외 이유도 적어요. 오래 걸린 응답을 빼고 평균 시간을 내면 실제 사용자가 기다리는 시간을 설명할 수 없어요.

5. 정답을 채점하는 규칙도 틀려 보게 해요

평가표를 검사하려고 일부러 틀린 답을 만들어 보세요. 담당자 두 명을 서로 바꾸거나, ‘미정’을 임의 날짜로 바꾸거나, 취소 업무를 다시 넣어요. 담당자 이름과 날짜가 답변 어딘가에 있다는 이유로 통과시키면 안 돼요. 올바른 업무 행에 연결돼 있어야 해요.

반대로 의미는 맞는데 표현만 다른 답도 넣어요. 규칙이 이를 불필요하게 탈락시키는지 확인해요. A01 사례처럼 발견한 내용과 수행 조건을 구분하면 무엇을 고쳐야 할지 보여요. J04 실제 출력에서는 빈 목록이어야 하는 자리에 실제 수정사항을 적은 실패도 볼 수 있어요. 조건 위반을 설명할 때 내용까지 지어냈다고 확대하지 않는 태도가 필요해요.

6. 작은 실험에 맞는 사용 범위를 정해요

평가 뒤에는 “이 두 행의 연습 자료에서는 담당자와 마감을 유지했다”처럼 확인한 범위를 적어요. 이어 다른 길이의 회의록, 취소가 여러 번 나온 사례, 담당자가 없는 사례를 추가해요. 사람의 확인 없이 써도 되는지, 초안까지만 맡길지, 실패하면 누가 수정할지를 결정해요.

아래 작성 도구에 평가 계획을 정리하고 실제 결과를 채워 보세요. 자동화나 코드 변경까지 비교하려면 하네스 평가 실습 가이드에서 실행 기록과 채점 변경 관리로 이어갈 수 있어요. 팀 교육을 준비한다면 무료 공개한 90분 AI 평가 실습 교안을 활용하세요. 진행자용 자료이며 모집 중인 행사 안내는 아니에요.

직접 기록하는 AI 평가 실습

AI 평가 실습표

같은 업무와 입력을 두고 현재 설정과 비교할 설정을 반복 실행해 보세요. 형식과 내용의 통과·실패·판단 보류는 도구가 아닌 여러분이 기록합니다.

입력은 서버로 전송하지 않으며 자동 저장되지 않습니다. 페이지를 떠나기 전에 결과를 복사하거나 파일로 내려받으세요.

1. 평가 설계

초 단위입니다. 이 시간을 넘기면 지연으로 기록합니다.

2. 실행 결과

처음에는 각 설정을 세 번씩 시험해 보세요. 적은 반복의 결과이므로 다른 입력에서도 확인해야 합니다.

반복 1
반복 2
반복 3

근거

  • foundby eval 평가 방법 — 반복 실행, 채점 구분, 재채점과 재실행 원칙을 공개한 자료
  • foundby eval A01·M05·J04 시나리오 — 입력, 필수 조건, 실제 출력과 실패 이유를 확인한 자료
  • Sociai 교육용 구성 — 공개 평가를 읽고 만든 가상 업무 예시와 실습 절차이며 별도 실측 결과가 아님