일반적인 프롬프트 평가 워크플로우는 객관적인 측정을 통해 프롬프트를 체계적으로 개선할 수 있도록 돕는 다섯 가지 핵심 단계를 따릅니다. 이러한 워크플로우를 구성하는 방법은 다양하며 여러 오픈 소스 및 유료 도구를 사용할 수 있지만, 핵심 프로세스를 이해하면 작게 시작해서 필요에 따라 확장할 수 있습니다.

1단계: 프롬프트 작성
개선하고자 하는 초기 프롬프트를 작성하는 것부터 시작하세요. 이 예시에서는 간단한 프롬프트를 사용하겠습니다:

이 기본 프롬프트는 테스트와 개선을 위한 기준선 역할을 합니다.
2단계: 평가 데이터셋 생성
평가 데이터셋에는 프로덕션 환경에서 프롬프트가 처리할 질문이나 요청 유형을 나타내는 샘플 입력이 포함됩니다. 데이터셋에는 프롬프트 템플릿에 삽입될 질문이 포함되어야 합니다.

이 예시에서는 데이터셋에 세 가지 질문이 포함됩니다:
- "2+2는 뭐야?"
- "오트밀은 어떻게 만들어?"
- "달은 얼마나 멀리 있어?"
실제 평가에서는 수십, 수백, 심지어 수천 개의 레코드를 가질 수 있습니다. 이러한 데이터셋은 직접 만들거나 Claude를 사용하여 생성할 수 있습니다.
3단계: Claude에 입력
데이터셋의 각 질문을 프롬프트 템플릿과 결합하여 완전한 프롬프트를 만듭니다. 그런 다음 각각을 Claude에 전송하여 응답을 받습니다.

예를 들어, 첫 번째 질문은 다음과 같이 됩니다:
Please answer the user's question:
What's 2+2?Claude는 수학 질문에 대해 "2 + 2 = 4"라고 응답하고, 두 번째 질문에 대해서는 오트밀 조리법을 제공하며, 세 번째 질문에 대해서는 달까지의 거리를 알려줄 수 있습니다.
4단계: 채점자에게 입력
채점자는 원래 질문과 Claude의 답변을 모두 검토하여 Claude의 응답 품질을 평가합니다. 이 단계는 일반적으로 1에서 10까지의 척도로 객관적인 점수를 제공하며, 10은 완벽한 답변을 나타내고 낮은 점수는 개선의 여지가 있음을 나타냅니다.

이 예시에서 채점자는 다음과 같이 점수를 부여할 수 있습니다:
- 수학 질문: 10 (완벽한 답변)
- 오트밀 질문: 4 (개선 필요)
- 달 질문: 9 (매우 좋은 답변)
모든 질문에 대한 평균 점수는 객관적인 측정값을 제공합니다: (10 + 4 + 9) ÷ 3 = 7.66
5단계: 프롬프트 변경 및 반복
이제 기준 점수를 확보했으므로, 프롬프트를 수정하고 전체 프로세스를 다시 실행하여 변경 사항이 성능을 개선하는지 확인할 수 있습니다.

예를 들어, 프롬프트에 더 많은 지침을 추가할 수 있습니다:
이 개선된 프롬프트를 동일한 평가 프로세스를 통해 실행한 후, 8.7이라는 더 높은 평균 점수를 얻을 수 있으며, 이는 추가된 지침이 Claude가 더 나은 응답을 제공하는 데 도움이 되었음을 나타냅니다.
프롬프트 채점
이 워크플로우의 핵심 이점은 프롬프트 성능에 대한 객관적인 측정값을 얻는 것입니다. 다음을 수행할 수 있습니다:
- 서로 다른 프롬프트 버전을 수치적으로 비교
- 최고 점수를 받은 버전 사용
- 더 나은 접근 방식을 찾기 위해 계속 반복

이러한 체계적인 접근 방식은 프롬프트 엔지니어링에서 추측을 제거하고, 변경 사항이 단순히 다른 변형이 아니라 실제로 개선임을 확신할 수 있게 해줍니다.