Bỏ qua để đến nội dung

Định dạng bộ đánh giá

JSONL, mỗi dòng một mẫu. Bốn loại kỳ vọng: khớp chính xác, quy tắc, điểm rubric và kiểm thử mã. Engine tự động giữ lại 20% làm lát mù không bao giờ tham gia tiến hoá và chỉ dùng cho xác minh cuối.

# evals.jsonl — one sample per line; expected can be an exact answer, a rule or a scoring rubric
{"id": "t-0001", "input": {"messages": [...]}, "expected": {"type": "exact", "value": "ORDER-8821 refunded"}}
{"id": "t-0002", "input": {"messages": [...]}, "expected": {"type": "rule", "must_call": "lookup_order", "must_not": ["escalate_to_human"]}}
{"id": "t-0003", "input": {"messages": [...]}, "expected": {"type": "rubric", "criteria": ["cites the correct return policy", "polite tone"], "judge": "ouro-judge-v1"}}
{"id": "t-0004", "input": {"messages": [...]}, "expected": {"type": "code", "tests": "tests/test_refund.py"}}