List Evaluations
Evaluations
List Evaluations
Retrieve all evaluations for the authenticated user.
This endpoint returns a paginated list of all evaluations created by the user, with optional filtering by status or model ID.
Query Parameters:
status(optional): Filter by evaluation status (PROCESSING,READY,FAILED)model_id(optional): Filter by specific model IDlimit(optional): Number of evaluations to return (1-100, default: 10)offset(optional): Number of evaluations to skip for pagination (default: 0)
Returns:
user_id: The authenticated user’s IDevaluations: List of evaluation objectstotal: Total number of evaluations matching the filterslimit: Requested page sizeoffset: Current pagination offset
Example Request:
GET /api/v3/evaluations?status=READY&limit=5&offset=0
Headers: {"Authorization": "Bearer <api_key>"}
Example Response:
{"user_id":"01KKBERWEEM634BQW9BK6Y0Y",
"evaluations":
[{"evaluation_id":"eval_01KKJHBNFY9STH1C9",
"model_id":"aligned-model-01kmqm4nrn9fw6r",
"benchmark_id":"benchmark_01KKBN96Q34K8807Q",
"status":"READY",
"judge_provider":"nugen",
"created_at":"2026-03-10T10:43:12.826791",
"metrics":
{"base_model":
{"answer_relevance_max":1.0,
"answer_relevance_min":1.0,
"answer_relevance_std":0.0,
"answer_relevance_mean":1.0,
"binary_correctness_max":1.0,
"binary_correctness_min":1.0,
"binary_correctness_std":0.0,
"binary_correctness_mean":1.0},
"eval_model":
{"answer_relevance_max":1.0,
"answer_relevance_min":1.0,
"answer_relevance_std":0.0,
"answer_relevance_mean":1.0,
"binary_correctness_max":1.0,
"binary_correctness_min":1.0,
"binary_correctness_std":0.0,
"binary_correctness_mean":1.0},
"comparison":
{"metrics":
[{"base":1.0,"metric":"binary_correctness_mean","evaluated":1.0,"improvement_%":0.0},
{"base":0.0,"metric":"binary_correctness_std","evaluated":0.0,"improvement_%":0},
{"base":1.0,"metric":"binary_correctness_min","evaluated":1.0,"improvement_%":0.0},
{"base":1.0,"metric":"binary_correctness_max","evaluated":1.0,"improvement_%":0.0},
{"base":1.0,"metric":"answer_relevance_mean","evaluated":1.0,"improvement_%":0.0},
{"base":0.0,"metric":"answer_relevance_std","evaluated":0.0,"improvement_%":0},
{"base":1.0,"metric":"answer_relevance_min","evaluated":1.0,"improvement_%":0.0},
{"base":1.0,"metric":"answer_relevance_max","evaluated":1.0,"improvement_%":0.0}],
"summary":{"avg_improvement":0.0,"max_improvement":0.0,"min_improvement":0.0}}}}],
"total":1,"limit":10,"offset":0}
GET
List Evaluations
Authorizations
Bearer authentication header of the form Bearer <token>, where <token> is your auth token.
Query Parameters
Filter by evaluation status
Filter by model ID
Number of evaluations to return
Required range:
1 <= x <= 100Number of evaluations to skip
Required range:
x >= 0Response
Successful Response