평가 세트 형식
JSONL, 한 줄에 샘플 하나. 기대값 유형은 네 가지: 정확 일치, 규칙, 루브릭 점수, 코드 테스트. 엔진은 20%를 블라인드 슬라이스로 자동 홀드아웃하며, 이 부분은 진화에 참여하지 않고 최종 검증에만 쓰입니다.
# evals.jsonl — 한 줄에 샘플 하나; expected는 정확한 답, 규칙, 또는 채점 루브릭{"id": "t-0001", "input": {"messages": [...]}, "expected": {"type": "exact", "value": "ORDER-8821 환불 완료"}}{"id": "t-0002", "input": {"messages": [...]}, "expected": {"type": "rule", "must_call": "lookup_order", "must_not": ["상담원 연결"]}}{"id": "t-0003", "input": {"messages": [...]}, "expected": {"type": "rubric", "criteria": ["올바른 반품 정책을 인용", "정중한 어조"], "judge": "ouro-judge-v1"}}{"id": "t-0004", "input": {"messages": [...]}, "expected": {"type": "code", "tests": "tests/test_refund.py"}}