quality
Create quality quality
Requires scopes: runs:write
POST
/
api
/
quality
Create quality quality
curl --request POST \
--url https://evalgate.com/api/quality \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '
{
"runId": 123,
"baseline": "production",
"minScore": 123,
"maxDrop": 123,
"warnDrop": 123,
"gateCheck": false,
"persistCheckReport": false
}
'import requests
url = "https://evalgate.com/api/quality"
payload = {
"runId": 123,
"baseline": "production",
"minScore": 123,
"maxDrop": 123,
"warnDrop": 123,
"gateCheck": False,
"persistCheckReport": False
}
headers = {
"Authorization": "Bearer <token>",
"Content-Type": "application/json"
}
response = requests.post(url, json=payload, headers=headers)
print(response.text)const options = {
method: 'POST',
headers: {Authorization: 'Bearer <token>', 'Content-Type': 'application/json'},
body: JSON.stringify({
runId: 123,
baseline: 'production',
minScore: 123,
maxDrop: 123,
warnDrop: 123,
gateCheck: false,
persistCheckReport: false
})
};
fetch('https://evalgate.com/api/quality', options)
.then(res => res.json())
.then(res => console.log(res))
.catch(err => console.error(err));<?php
$curl = curl_init();
curl_setopt_array($curl, [
CURLOPT_URL => "https://evalgate.com/api/quality",
CURLOPT_RETURNTRANSFER => true,
CURLOPT_ENCODING => "",
CURLOPT_MAXREDIRS => 10,
CURLOPT_TIMEOUT => 30,
CURLOPT_HTTP_VERSION => CURL_HTTP_VERSION_1_1,
CURLOPT_CUSTOMREQUEST => "POST",
CURLOPT_POSTFIELDS => json_encode([
'runId' => 123,
'baseline' => 'production',
'minScore' => 123,
'maxDrop' => 123,
'warnDrop' => 123,
'gateCheck' => false,
'persistCheckReport' => false
]),
CURLOPT_HTTPHEADER => [
"Authorization: Bearer <token>",
"Content-Type: application/json"
],
]);
$response = curl_exec($curl);
$err = curl_error($curl);
curl_close($curl);
if ($err) {
echo "cURL Error #:" . $err;
} else {
echo $response;
}package main
import (
"fmt"
"strings"
"net/http"
"io"
)
func main() {
url := "https://evalgate.com/api/quality"
payload := strings.NewReader("{\n \"runId\": 123,\n \"baseline\": \"production\",\n \"minScore\": 123,\n \"maxDrop\": 123,\n \"warnDrop\": 123,\n \"gateCheck\": false,\n \"persistCheckReport\": false\n}")
req, _ := http.NewRequest("POST", url, payload)
req.Header.Add("Authorization", "Bearer <token>")
req.Header.Add("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)
defer res.Body.Close()
body, _ := io.ReadAll(res.Body)
fmt.Println(string(body))
}HttpResponse<String> response = Unirest.post("https://evalgate.com/api/quality")
.header("Authorization", "Bearer <token>")
.header("Content-Type", "application/json")
.body("{\n \"runId\": 123,\n \"baseline\": \"production\",\n \"minScore\": 123,\n \"maxDrop\": 123,\n \"warnDrop\": 123,\n \"gateCheck\": false,\n \"persistCheckReport\": false\n}")
.asString();require 'uri'
require 'net/http'
url = URI("https://evalgate.com/api/quality")
http = Net::HTTP.new(url.host, url.port)
http.use_ssl = true
request = Net::HTTP::Post.new(url)
request["Authorization"] = 'Bearer <token>'
request["Content-Type"] = 'application/json'
request.body = "{\n \"runId\": 123,\n \"baseline\": \"production\",\n \"minScore\": 123,\n \"maxDrop\": 123,\n \"warnDrop\": 123,\n \"gateCheck\": false,\n \"persistCheckReport\": false\n}"
response = http.request(request)
puts response.read_body{
"success": true,
"runId": 123,
"integrity": {
"summary": {
"byBehavior": {
"tool_use": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"classification": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"retrieval": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"extraction": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"multi_step_reasoning": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
}
},
"byDifficulty": {
"medium": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"hard": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"easy": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"flaky": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
}
},
"metadata": {
"totalCases": 123,
"evaluatedAt": "<string>",
"evaluationRunId": 123,
"uncategorizedBehaviorCount": 123,
"uncategorizedDifficultyCount": 123
},
"trajectory": {
"efficiency": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"toolUsage": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
}
},
"workflow": {
"axes": {
"autonomyFit": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"escalationQuality": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"approvalSafety": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"hookCompliance": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"memoryCorrectness": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"recoveryQuality": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"handoffQuality": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"debuggability": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
}
},
"slices": {
"byAutonomy": {
"manual": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"default_approvals": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"bypass_approvals": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"autopilot": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
}
},
"byWorkflowClass": {
"approval_gated_mutation": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"background_execution": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"recovery_required": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"policy_conflict": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"handoff_heavy": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"memory_sensitive": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"parallel_tool_use": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
}
}
}
}
},
"datasetIntegrity": {
"behaviorDistribution": {
"tool_use": 123,
"classification": 123,
"retrieval": 123,
"extraction": 123,
"multi_step_reasoning": 123
},
"difficultyDistribution": {
"medium": 123,
"hard": 123,
"easy": 123,
"flaky": 123
},
"failureOriginShare": 123,
"syntheticOnly": true,
"coverageWarnings": [
"metric_missing_data"
]
},
"metricValidity": {
"historicalSnapshotsChecked": 123,
"driftSignals": [
{
"metric": "<string>",
"currentMean": 123,
"previousMean": 123,
"delta": 123,
"triggered": true
}
],
"improvementWithoutFailureReduction": true
},
"antiGaming": {
"improvedEasyBucketOnly": true,
"failureDistributionStagnant": true,
"redundancyIncreaseWithScoreGain": true,
"detected": true
},
"coverageIntegrity": {
"coverageByBehavior": {
"tool_use": 123,
"classification": 123,
"retrieval": 123,
"extraction": 123,
"multi_step_reasoning": 123
},
"dominantFailureMode": {
"mode": "<string>",
"share": 123
},
"lowFailureDiversity": true
},
"lifecycle": {
"counts": {
"active": 123,
"validated": 123,
"superseded": 123,
"deprecated": 123,
"archived": 123,
"candidate": 123,
"active_gate": 123
},
"recommendedTransitions": [
{
"testCaseId": 123,
"currentState": "active",
"nextState": "active",
"reason": "manual_approval"
}
]
},
"warnings": [
{
"code": "metric_missing_data",
"severity": "critical",
"message": "<string>",
"context": {}
}
],
"events": [
{
"type": "metric_drift_detected",
"message": "<string>",
"context": {}
}
],
"metadata": {
"totalWarnings": 123,
"refreshedAt": "<string>",
"sourceTrajectoryMetricsAvailable": true,
"overallPassRate": 123,
"averageTrajectoryRedundancy": 123
}
},
"workflowCoverage": {
"totalCases": 123,
"agentWorkflowCases": 123,
"coverageRate": 123,
"workflowClassDistribution": {
"approval_gated_mutation": 123,
"background_execution": 123,
"recovery_required": 123,
"policy_conflict": 123,
"handoff_heavy": 123,
"memory_sensitive": 123,
"parallel_tool_use": 123
},
"autonomyDistribution": {
"manual": 123,
"default_approvals": 123,
"bypass_approvals": 123,
"autopilot": 123
},
"generatedCandidateCount": 123,
"experimentRecipeCount": 123,
"gaps": [
{
"id": "<string>",
"workflowClass": "approval_gated_mutation",
"severity": "critical",
"description": "<string>",
"recommendation": "<string>"
}
]
},
"gateResult": {
"passed": true,
"severity": "pass",
"reasonCode": "<string>",
"reasonMessage": "<string>",
"gateSkipped": false
},
"checkReport": {
"schemaVersion": 123,
"evaluationId": "<string>",
"runId": 123,
"verdict": "pass",
"gateApplied": true,
"gateMode": "enforced",
"reasonCode": "<string>",
"checkedAt": "<string>",
"source": "app-gate",
"reasonMessage": "<string>",
"actionableMessage": "<string>",
"score": 123,
"baselineScore": 123,
"delta": 123,
"baselineMissing": false,
"baselineRunId": 123,
"flags": [
"<string>"
],
"thresholds": {
"minScore": 123,
"baseline": "production",
"maxDrop": 123,
"warnDrop": 123
},
"n": 123,
"evidenceLevel": "<string>",
"dashboardUrl": "<string>"
},
"qualityScore": {
"score": 123,
"breakdown": {
"passRate": 123,
"safety": 123,
"judge": 123,
"schema": 123,
"latency": 123,
"cost": 123
},
"flags": [
"<string>"
],
"evidenceLevel": "medium",
"scoringVersion": "v1",
"scoringSpecHash": "<string>"
}
}{
"error": {
"message": "<string>",
"details": "<unknown>",
"requestId": "3c90c3cc-0d44-4b50-8888-8dd25736052a"
}
}{
"error": {
"message": "<string>",
"details": "<unknown>",
"requestId": "3c90c3cc-0d44-4b50-8888-8dd25736052a"
}
}{
"error": {
"message": "<string>",
"details": "<unknown>",
"requestId": "3c90c3cc-0d44-4b50-8888-8dd25736052a"
}
}{
"error": {
"message": "<string>",
"details": "<unknown>",
"requestId": "3c90c3cc-0d44-4b50-8888-8dd25736052a"
}
}{
"error": {
"message": "<string>",
"details": "<unknown>",
"requestId": "3c90c3cc-0d44-4b50-8888-8dd25736052a"
}
}{
"error": {
"message": "<string>",
"details": "<unknown>",
"requestId": "3c90c3cc-0d44-4b50-8888-8dd25736052a"
}
}{
"error": {
"message": "<string>",
"details": "<unknown>",
"requestId": "3c90c3cc-0d44-4b50-8888-8dd25736052a"
}
}Authorizations
Bearer authentication header of the form Bearer <token>, where <token> is your auth token.
Body
application/json
baseline
Option 1 · enum<string>Option 2 · enum<string>Option 3 · enum<string>Option 4 · enum<string>
Available options:
production Available options:
false Available options:
false Show child attributes
Show child attributes
Response
Successful response
Available options:
true Show child attributes
Show child attributes
Show child attributes
Show child attributes
Show child attributes
Show child attributes
Show child attributes
Show child attributes
Show child attributes
Show child attributes
⌘I
Create quality quality
curl --request POST \
--url https://evalgate.com/api/quality \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '
{
"runId": 123,
"baseline": "production",
"minScore": 123,
"maxDrop": 123,
"warnDrop": 123,
"gateCheck": false,
"persistCheckReport": false
}
'import requests
url = "https://evalgate.com/api/quality"
payload = {
"runId": 123,
"baseline": "production",
"minScore": 123,
"maxDrop": 123,
"warnDrop": 123,
"gateCheck": False,
"persistCheckReport": False
}
headers = {
"Authorization": "Bearer <token>",
"Content-Type": "application/json"
}
response = requests.post(url, json=payload, headers=headers)
print(response.text)const options = {
method: 'POST',
headers: {Authorization: 'Bearer <token>', 'Content-Type': 'application/json'},
body: JSON.stringify({
runId: 123,
baseline: 'production',
minScore: 123,
maxDrop: 123,
warnDrop: 123,
gateCheck: false,
persistCheckReport: false
})
};
fetch('https://evalgate.com/api/quality', options)
.then(res => res.json())
.then(res => console.log(res))
.catch(err => console.error(err));<?php
$curl = curl_init();
curl_setopt_array($curl, [
CURLOPT_URL => "https://evalgate.com/api/quality",
CURLOPT_RETURNTRANSFER => true,
CURLOPT_ENCODING => "",
CURLOPT_MAXREDIRS => 10,
CURLOPT_TIMEOUT => 30,
CURLOPT_HTTP_VERSION => CURL_HTTP_VERSION_1_1,
CURLOPT_CUSTOMREQUEST => "POST",
CURLOPT_POSTFIELDS => json_encode([
'runId' => 123,
'baseline' => 'production',
'minScore' => 123,
'maxDrop' => 123,
'warnDrop' => 123,
'gateCheck' => false,
'persistCheckReport' => false
]),
CURLOPT_HTTPHEADER => [
"Authorization: Bearer <token>",
"Content-Type: application/json"
],
]);
$response = curl_exec($curl);
$err = curl_error($curl);
curl_close($curl);
if ($err) {
echo "cURL Error #:" . $err;
} else {
echo $response;
}package main
import (
"fmt"
"strings"
"net/http"
"io"
)
func main() {
url := "https://evalgate.com/api/quality"
payload := strings.NewReader("{\n \"runId\": 123,\n \"baseline\": \"production\",\n \"minScore\": 123,\n \"maxDrop\": 123,\n \"warnDrop\": 123,\n \"gateCheck\": false,\n \"persistCheckReport\": false\n}")
req, _ := http.NewRequest("POST", url, payload)
req.Header.Add("Authorization", "Bearer <token>")
req.Header.Add("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)
defer res.Body.Close()
body, _ := io.ReadAll(res.Body)
fmt.Println(string(body))
}HttpResponse<String> response = Unirest.post("https://evalgate.com/api/quality")
.header("Authorization", "Bearer <token>")
.header("Content-Type", "application/json")
.body("{\n \"runId\": 123,\n \"baseline\": \"production\",\n \"minScore\": 123,\n \"maxDrop\": 123,\n \"warnDrop\": 123,\n \"gateCheck\": false,\n \"persistCheckReport\": false\n}")
.asString();require 'uri'
require 'net/http'
url = URI("https://evalgate.com/api/quality")
http = Net::HTTP.new(url.host, url.port)
http.use_ssl = true
request = Net::HTTP::Post.new(url)
request["Authorization"] = 'Bearer <token>'
request["Content-Type"] = 'application/json'
request.body = "{\n \"runId\": 123,\n \"baseline\": \"production\",\n \"minScore\": 123,\n \"maxDrop\": 123,\n \"warnDrop\": 123,\n \"gateCheck\": false,\n \"persistCheckReport\": false\n}"
response = http.request(request)
puts response.read_body{
"success": true,
"runId": 123,
"integrity": {
"summary": {
"byBehavior": {
"tool_use": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"classification": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"retrieval": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"extraction": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"multi_step_reasoning": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
}
},
"byDifficulty": {
"medium": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"hard": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"easy": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"flaky": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
}
},
"metadata": {
"totalCases": 123,
"evaluatedAt": "<string>",
"evaluationRunId": 123,
"uncategorizedBehaviorCount": 123,
"uncategorizedDifficultyCount": 123
},
"trajectory": {
"efficiency": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"toolUsage": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
}
},
"workflow": {
"axes": {
"autonomyFit": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"escalationQuality": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"approvalSafety": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"hookCompliance": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"memoryCorrectness": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"recoveryQuality": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"handoffQuality": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"debuggability": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
}
},
"slices": {
"byAutonomy": {
"manual": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"default_approvals": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"bypass_approvals": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"autopilot": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
}
},
"byWorkflowClass": {
"approval_gated_mutation": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"background_execution": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"recovery_required": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"policy_conflict": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"handoff_heavy": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"memory_sensitive": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
},
"parallel_tool_use": {
"mean": 123,
"stdDev": 123,
"n": 123,
"confidenceInterval": {
"lower": 123,
"upper": 123,
"method": "normal"
},
"composition": {
"percentageOfDataset": 123
},
"status": "valid",
"warnings": [
"metric_missing_data"
]
}
}
}
}
},
"datasetIntegrity": {
"behaviorDistribution": {
"tool_use": 123,
"classification": 123,
"retrieval": 123,
"extraction": 123,
"multi_step_reasoning": 123
},
"difficultyDistribution": {
"medium": 123,
"hard": 123,
"easy": 123,
"flaky": 123
},
"failureOriginShare": 123,
"syntheticOnly": true,
"coverageWarnings": [
"metric_missing_data"
]
},
"metricValidity": {
"historicalSnapshotsChecked": 123,
"driftSignals": [
{
"metric": "<string>",
"currentMean": 123,
"previousMean": 123,
"delta": 123,
"triggered": true
}
],
"improvementWithoutFailureReduction": true
},
"antiGaming": {
"improvedEasyBucketOnly": true,
"failureDistributionStagnant": true,
"redundancyIncreaseWithScoreGain": true,
"detected": true
},
"coverageIntegrity": {
"coverageByBehavior": {
"tool_use": 123,
"classification": 123,
"retrieval": 123,
"extraction": 123,
"multi_step_reasoning": 123
},
"dominantFailureMode": {
"mode": "<string>",
"share": 123
},
"lowFailureDiversity": true
},
"lifecycle": {
"counts": {
"active": 123,
"validated": 123,
"superseded": 123,
"deprecated": 123,
"archived": 123,
"candidate": 123,
"active_gate": 123
},
"recommendedTransitions": [
{
"testCaseId": 123,
"currentState": "active",
"nextState": "active",
"reason": "manual_approval"
}
]
},
"warnings": [
{
"code": "metric_missing_data",
"severity": "critical",
"message": "<string>",
"context": {}
}
],
"events": [
{
"type": "metric_drift_detected",
"message": "<string>",
"context": {}
}
],
"metadata": {
"totalWarnings": 123,
"refreshedAt": "<string>",
"sourceTrajectoryMetricsAvailable": true,
"overallPassRate": 123,
"averageTrajectoryRedundancy": 123
}
},
"workflowCoverage": {
"totalCases": 123,
"agentWorkflowCases": 123,
"coverageRate": 123,
"workflowClassDistribution": {
"approval_gated_mutation": 123,
"background_execution": 123,
"recovery_required": 123,
"policy_conflict": 123,
"handoff_heavy": 123,
"memory_sensitive": 123,
"parallel_tool_use": 123
},
"autonomyDistribution": {
"manual": 123,
"default_approvals": 123,
"bypass_approvals": 123,
"autopilot": 123
},
"generatedCandidateCount": 123,
"experimentRecipeCount": 123,
"gaps": [
{
"id": "<string>",
"workflowClass": "approval_gated_mutation",
"severity": "critical",
"description": "<string>",
"recommendation": "<string>"
}
]
},
"gateResult": {
"passed": true,
"severity": "pass",
"reasonCode": "<string>",
"reasonMessage": "<string>",
"gateSkipped": false
},
"checkReport": {
"schemaVersion": 123,
"evaluationId": "<string>",
"runId": 123,
"verdict": "pass",
"gateApplied": true,
"gateMode": "enforced",
"reasonCode": "<string>",
"checkedAt": "<string>",
"source": "app-gate",
"reasonMessage": "<string>",
"actionableMessage": "<string>",
"score": 123,
"baselineScore": 123,
"delta": 123,
"baselineMissing": false,
"baselineRunId": 123,
"flags": [
"<string>"
],
"thresholds": {
"minScore": 123,
"baseline": "production",
"maxDrop": 123,
"warnDrop": 123
},
"n": 123,
"evidenceLevel": "<string>",
"dashboardUrl": "<string>"
},
"qualityScore": {
"score": 123,
"breakdown": {
"passRate": 123,
"safety": 123,
"judge": 123,
"schema": 123,
"latency": 123,
"cost": 123
},
"flags": [
"<string>"
],
"evidenceLevel": "medium",
"scoringVersion": "v1",
"scoringSpecHash": "<string>"
}
}{
"error": {
"message": "<string>",
"details": "<unknown>",
"requestId": "3c90c3cc-0d44-4b50-8888-8dd25736052a"
}
}{
"error": {
"message": "<string>",
"details": "<unknown>",
"requestId": "3c90c3cc-0d44-4b50-8888-8dd25736052a"
}
}{
"error": {
"message": "<string>",
"details": "<unknown>",
"requestId": "3c90c3cc-0d44-4b50-8888-8dd25736052a"
}
}{
"error": {
"message": "<string>",
"details": "<unknown>",
"requestId": "3c90c3cc-0d44-4b50-8888-8dd25736052a"
}
}{
"error": {
"message": "<string>",
"details": "<unknown>",
"requestId": "3c90c3cc-0d44-4b50-8888-8dd25736052a"
}
}{
"error": {
"message": "<string>",
"details": "<unknown>",
"requestId": "3c90c3cc-0d44-4b50-8888-8dd25736052a"
}
}{
"error": {
"message": "<string>",
"details": "<unknown>",
"requestId": "3c90c3cc-0d44-4b50-8888-8dd25736052a"
}
}