플레이그라운드로 돌아가기

prompt evaluation lab

프롬프트 배틀 아레나

후보 프롬프트를 같은 입력·모델·온도에서 실제 실행하고, 이름을 가린 결과를 가중 평가 기준으로 심사해 재현 가능한 실험 리포트를 만듭니다.

AI 엔진

실험 설계

후보 프롬프트

3/4
A
139설계 요소 4/5
B
123설계 요소 4/5
C
134설계 요소 2/5

평가 루브릭

합계 100
각 후보를 독립적으로 실행한 뒤 심사 요청을 한 번 더 보냅니다. 개인 API 키가 없으면 로그인 계정의 무료 토큰이 요청별로 사용됩니다.

점수가 아니라 근거가 남는 실험

동일 조건 실행, 응답 시간, 항목별 점수, 장단점과 치명적 문제를 함께 보여주므로 다음 프롬프트 수정 방향을 설명할 수 있습니다.

최근 배틀

완료한 실험 리포트가 이 브라우저에 최대 6개까지 저장됩니다.