curl --request GET \
--url https://api.nugen.in/api/v3/evaluations/{evaluation_id}/results \
--header 'Authorization: Bearer <token>'import requests
url = "https://api.nugen.in/api/v3/evaluations/{evaluation_id}/results"
headers = {"Authorization": "Bearer <token>"}
response = requests.get(url, headers=headers)
print(response.text)const options = {method: 'GET', headers: {Authorization: 'Bearer <token>'}};
fetch('https://api.nugen.in/api/v3/evaluations/{evaluation_id}/results', options)
.then(res => res.json())
.then(res => console.log(res))
.catch(err => console.error(err));<?php
$curl = curl_init();
curl_setopt_array($curl, [
CURLOPT_URL => "https://api.nugen.in/api/v3/evaluations/{evaluation_id}/results",
CURLOPT_RETURNTRANSFER => true,
CURLOPT_ENCODING => "",
CURLOPT_MAXREDIRS => 10,
CURLOPT_TIMEOUT => 30,
CURLOPT_HTTP_VERSION => CURL_HTTP_VERSION_1_1,
CURLOPT_CUSTOMREQUEST => "GET",
CURLOPT_HTTPHEADER => [
"Authorization: Bearer <token>"
],
]);
$response = curl_exec($curl);
$err = curl_error($curl);
curl_close($curl);
if ($err) {
echo "cURL Error #:" . $err;
} else {
echo $response;
}package main
import (
"fmt"
"net/http"
"io"
)
func main() {
url := "https://api.nugen.in/api/v3/evaluations/{evaluation_id}/results"
req, _ := http.NewRequest("GET", url, nil)
req.Header.Add("Authorization", "Bearer <token>")
res, _ := http.DefaultClient.Do(req)
defer res.Body.Close()
body, _ := io.ReadAll(res.Body)
fmt.Println(string(body))
}HttpResponse<String> response = Unirest.get("https://api.nugen.in/api/v3/evaluations/{evaluation_id}/results")
.header("Authorization", "Bearer <token>")
.asString();require 'uri'
require 'net/http'
url = URI("https://api.nugen.in/api/v3/evaluations/{evaluation_id}/results")
http = Net::HTTP.new(url.host, url.port)
http.use_ssl = true
request = Net::HTTP::Get.new(url)
request["Authorization"] = 'Bearer <token>'
response = http.request(request)
puts response.read_body{
"evaluation_id": "evaluation_01k4x9m2p7q3r7b1",
"raw_responses_count": 100,
"metrics": {},
"method": "eval-compare",
"baseline_model_id": "model_01k4x9m2p7q3r9d2",
"base_model": "qwen-v2p5-0p5b-instruct",
"eval_model": {
"accuracy": 0.85
},
"comparison": {
"accuracy_difference": 0.05
}
}{
"detail": [
{
"loc": [
"<string>"
],
"msg": "<string>",
"type": "<string>"
}
]
}Get Evaluation Results
Retrieve the complete results of a finished evaluation.
This endpoint returns detailed evaluation metrics and scores for a completed evaluation. Works for both single model evaluations and comparison mode evaluations.
Path Parameters:
evaluation_id: Unique evaluation identifier
Returns:
evaluation_id: The evaluation identifierraw_responses_count: Number of raw responses generated during evaluationmethod(optional): Evaluation method (evalfor single model,eval-comparefor comparison)metrics(optional): Evaluation metrics and scores (single model only)baseline_model_id(optional): Baseline model ID (comparison mode only)base_model(optional): Base model results (comparison mode only)eval_model(optional): Eval model results (comparison mode only)comparison(optional): Comparison results between models (comparison mode only)
Identity, status, and timestamps are served by GET /{evaluation_id}.
Raises:
404: If evaluation not found or doesn’t belong to the authenticated user400: If evaluation is not yet completed, or FAILED with no results
Example Request:
GET /api/v3/evaluations/evaluation_01k4x9m2p7q3r7b1/results
Headers: {"Authorization": "Bearer <api_key>"}
Example Response (Single Model):
{
"evaluation_id": "evaluation_01k4x9m2p7q3r7b1",
"method": "eval",
"raw_responses_count": 10,
"metrics": {
"accuracy": 0.92,
"relevance": 0.88,
"average_score": 0.90,
"n_samples": 10,
"correct_answers": 9
}
}
Example Response (Comparison Mode):
{
"evaluation_id": "evaluation_01k4x9m2p7q3r7b1",
"baseline_model_id": "model_01kmqm4nrn9fw6r",
"method": "eval-compare",
"raw_responses_count": 20,
"base_model": {
"model_id": "qwen-v2p5-0p5b-instruct",
"average_score": 0.92,
"n_samples": 10
},
"eval_model": {
"model_id": "model_01k4x9m2p7q3r9d3",
"average_score": 0.85,
"n_samples": 10
},
"comparison": {
"winner": "qwen-v2p5-0p5b-instruct",
"score_difference": 0.07,
"statistical_significance": true
}
}
curl --request GET \
--url https://api.nugen.in/api/v3/evaluations/{evaluation_id}/results \
--header 'Authorization: Bearer <token>'import requests
url = "https://api.nugen.in/api/v3/evaluations/{evaluation_id}/results"
headers = {"Authorization": "Bearer <token>"}
response = requests.get(url, headers=headers)
print(response.text)const options = {method: 'GET', headers: {Authorization: 'Bearer <token>'}};
fetch('https://api.nugen.in/api/v3/evaluations/{evaluation_id}/results', options)
.then(res => res.json())
.then(res => console.log(res))
.catch(err => console.error(err));<?php
$curl = curl_init();
curl_setopt_array($curl, [
CURLOPT_URL => "https://api.nugen.in/api/v3/evaluations/{evaluation_id}/results",
CURLOPT_RETURNTRANSFER => true,
CURLOPT_ENCODING => "",
CURLOPT_MAXREDIRS => 10,
CURLOPT_TIMEOUT => 30,
CURLOPT_HTTP_VERSION => CURL_HTTP_VERSION_1_1,
CURLOPT_CUSTOMREQUEST => "GET",
CURLOPT_HTTPHEADER => [
"Authorization: Bearer <token>"
],
]);
$response = curl_exec($curl);
$err = curl_error($curl);
curl_close($curl);
if ($err) {
echo "cURL Error #:" . $err;
} else {
echo $response;
}package main
import (
"fmt"
"net/http"
"io"
)
func main() {
url := "https://api.nugen.in/api/v3/evaluations/{evaluation_id}/results"
req, _ := http.NewRequest("GET", url, nil)
req.Header.Add("Authorization", "Bearer <token>")
res, _ := http.DefaultClient.Do(req)
defer res.Body.Close()
body, _ := io.ReadAll(res.Body)
fmt.Println(string(body))
}HttpResponse<String> response = Unirest.get("https://api.nugen.in/api/v3/evaluations/{evaluation_id}/results")
.header("Authorization", "Bearer <token>")
.asString();require 'uri'
require 'net/http'
url = URI("https://api.nugen.in/api/v3/evaluations/{evaluation_id}/results")
http = Net::HTTP.new(url.host, url.port)
http.use_ssl = true
request = Net::HTTP::Get.new(url)
request["Authorization"] = 'Bearer <token>'
response = http.request(request)
puts response.read_body{
"evaluation_id": "evaluation_01k4x9m2p7q3r7b1",
"raw_responses_count": 100,
"metrics": {},
"method": "eval-compare",
"baseline_model_id": "model_01k4x9m2p7q3r9d2",
"base_model": "qwen-v2p5-0p5b-instruct",
"eval_model": {
"accuracy": 0.85
},
"comparison": {
"accuracy_difference": 0.05
}
}{
"detail": [
{
"loc": [
"<string>"
],
"msg": "<string>",
"type": "<string>"
}
]
}Authorizations
Bearer authentication header of the form Bearer <token>, where <token> is your auth token.
Path Parameters
Response
Returns detailed evaluation metrics and scores for a completed evaluation. Identity, status, and timestamps are served by GET /{evaluation_id}.
The evaluation's scored results. Identity, status and timestamps are served by GET /{evaluation_id}.
Unique identifier for the evaluation
"evaluation_01k4x9m2p7q3r7b1"
Number of raw responses generated; read metric means relative to this size
100
Metric names and scores. binary_correctness_mean is the fraction of responses whose key facts match the benchmark's expected response (0 to 1). answer_relevance_mean rates how relevant each response is to its instruction (0 to 1) and ignores correctness; read the pair together. The metric set evolves with our evaluation research.
Evaluation method: 'eval' or 'eval-compare'
"eval-compare"
ID of baseline model (for comparison)
"model_01k4x9m2p7q3r9d2"
Base model results (comparison mode)
"qwen-v2p5-0p5b-instruct"
Eval model results (comparison mode)
{ "accuracy": 0.85 }
Comparison results between models
{ "accuracy_difference": 0.05 }
Was this page helpful?