일반적인 평가 워크플로우

강의 1010분
Sign in to save your progressYou can keep reading without an account, but completed lessons won't be saved.
Sign in

일반적인 프롬프트 평가 워크플로우는 객관적인 측정을 통해 프롬프트를 체계적으로 개선할 수 있도록 돕는 다섯 가지 핵심 단계를 따릅니다. 이러한 워크플로우를 구성하는 방법은 다양하며 여러 오픈 소스 및 유료 도구를 사용할 수 있지만, 핵심 프로세스를 이해하면 작게 시작해서 필요에 따라 확장할 수 있습니다.

1단계: 프롬프트 작성

개선하고자 하는 초기 프롬프트를 작성하는 것부터 시작하세요. 이 예시에서는 간단한 프롬프트를 사용하겠습니다:

python
prompt = f"""
Please answer the user's question:

{question}
"""

이 기본 프롬프트는 테스트와 개선을 위한 기준선 역할을 합니다.

2단계: 평가 데이터셋 생성

평가 데이터셋에는 프로덕션 환경에서 프롬프트가 처리할 질문이나 요청 유형을 나타내는 샘플 입력이 포함됩니다. 데이터셋에는 프롬프트 템플릿에 삽입될 질문이 포함되어야 합니다.

이 예시에서는 데이터셋에 세 가지 질문이 포함됩니다:

  • "2+2는 뭐야?"
  • "오트밀은 어떻게 만들어?"
  • "달은 얼마나 멀리 있어?"

실제 평가에서는 수십, 수백, 심지어 수천 개의 레코드를 가질 수 있습니다. 이러한 데이터셋은 직접 만들거나 Claude를 사용하여 생성할 수 있습니다.

3단계: Claude에 입력

데이터셋의 각 질문을 프롬프트 템플릿과 결합하여 완전한 프롬프트를 만듭니다. 그런 다음 각각을 Claude에 전송하여 응답을 받습니다.

예를 들어, 첫 번째 질문은 다음과 같이 됩니다:

Please answer the user's question:
What's 2+2?

Claude는 수학 질문에 대해 "2 + 2 = 4"라고 응답하고, 두 번째 질문에 대해서는 오트밀 조리법을 제공하며, 세 번째 질문에 대해서는 달까지의 거리를 알려줄 수 있습니다.

4단계: 채점자에게 입력

채점자는 원래 질문과 Claude의 답변을 모두 검토하여 Claude의 응답 품질을 평가합니다. 이 단계는 일반적으로 1에서 10까지의 척도로 객관적인 점수를 제공하며, 10은 완벽한 답변을 나타내고 낮은 점수는 개선의 여지가 있음을 나타냅니다.

이 예시에서 채점자는 다음과 같이 점수를 부여할 수 있습니다:

  • 수학 질문: 10 (완벽한 답변)
  • 오트밀 질문: 4 (개선 필요)
  • 달 질문: 9 (매우 좋은 답변)

모든 질문에 대한 평균 점수는 객관적인 측정값을 제공합니다: (10 + 4 + 9) ÷ 3 = 7.66

5단계: 프롬프트 변경 및 반복

이제 기준 점수를 확보했으므로, 프롬프트를 수정하고 전체 프로세스를 다시 실행하여 변경 사항이 성능을 개선하는지 확인할 수 있습니다.

예를 들어, 프롬프트에 더 많은 지침을 추가할 수 있습니다:

python
prompt = f"""
Please answer the user's question:

{question}

Answer the question with ample detail
"""

이 개선된 프롬프트를 동일한 평가 프로세스를 통해 실행한 후, 8.7이라는 더 높은 평균 점수를 얻을 수 있으며, 이는 추가된 지침이 Claude가 더 나은 응답을 제공하는 데 도움이 되었음을 나타냅니다.

프롬프트 채점

이 워크플로우의 핵심 이점은 프롬프트 성능에 대한 객관적인 측정값을 얻는 것입니다. 다음을 수행할 수 있습니다:

  • 서로 다른 프롬프트 버전을 수치적으로 비교
  • 최고 점수를 받은 버전 사용
  • 더 나은 접근 방식을 찾기 위해 계속 반복

이러한 체계적인 접근 방식은 프롬프트 엔지니어링에서 추측을 제거하고, 변경 사항이 단순히 다른 변형이 아니라 실제로 개선임을 확신할 수 있게 해줍니다.