{
  "context": {
    "cap_tokens": 129984,
    "max_model_len": 131072,
    "targets": []
  },
  "failures": [
    {
      "error": "python-stdlib; bounded-retention; external-evidence; degraded-capability",
      "eval_id": "low-overhead-dashboard-architecture",
      "suite": "milestone-execution"
    },
    {
      "error": "ordered-chain; artifact-boundary",
      "eval_id": "milestone-dependency-order",
      "suite": "milestone-execution"
    },
    {
      "error": "reject-incomplete; capture-proof; strict-reapply",
      "eval_id": "proof-buffer-recovery",
      "suite": "milestone-execution"
    },
    {
      "error": "timeout-alignment; persist-resume; reuse-pr; no-ci-bypass",
      "eval_id": "resumable-ci-monitor",
      "suite": "milestone-execution"
    },
    {
      "error": "backup-first; remote-target; preserve-untracked; verify-identical",
      "eval_id": "local-remote-main-reconciliation",
      "suite": "milestone-execution"
    }
  ],
  "identity": {
    "base_url": "http://127.0.0.1:30002/v1",
    "candidate_id": "gpt-oss-120b-baseline",
    "config_id": "vllm-0.23.1-mxfp4-131k",
    "model": "gpt-oss-120b",
    "started_at": "2026-07-12T07:42:06Z"
  },
  "intelligence": {
    "checks": [],
    "status": "not_run"
  },
  "run_id": "fast-bakeoff-20260712T074206Z",
  "schema": "anvil-serving.fast-tier-bakeoff/v1",
  "score_inputs": {
    "e2e_p50_ms": 0.0,
    "intelligence_pass_rate": null,
    "operational_fit_notes": [
      "endpoint was already loaded; benchmark did not start or stop serves"
    ],
    "session_recall_passed": false,
    "thinking_mode": "disabled",
    "tool_call_passed": false,
    "ttft_p50_ms": 0.0,
    "usable_context_tokens": null,
    "voice_latency_ms": null
  },
  "selection": {
    "context_targets": [
      32768
    ],
    "endpoint_already_loaded": true,
    "requests_per_context": 1,
    "suites": []
  },
  "session": {
    "checks": [],
    "status": "not_run"
  },
  "source_recipe": {
    "ref": "examples/primary-node/docker-compose.yml",
    "serve_command": "anvil-serving serves up --manifest examples/primary-node/serves.toml heavy --confirm"
  },
  "suites": {
    "milestone-execution": {
      "checks": [
        {
          "content_excerpt": "",
          "error": "python-stdlib; bounded-retention; external-evidence; degraded-capability",
          "id": "low-overhead-dashboard-architecture",
          "latency_ms": 2144.174575805664,
          "status": "failed",
          "text_checks": [
            {
              "name": "python-stdlib",
              "passed": false
            },
            {
              "name": "bounded-retention",
              "passed": false
            },
            {
              "name": "external-evidence",
              "passed": false
            },
            {
              "name": "degraded-capability",
              "passed": false
            }
          ],
          "validator": "deterministic_text_checks"
        },
        {
          "content_excerpt": "",
          "error": "ordered-chain; artifact-boundary",
          "id": "milestone-dependency-order",
          "latency_ms": 1381.8657398223877,
          "status": "failed",
          "text_checks": [
            {
              "name": "ordered-chain",
              "passed": false
            },
            {
              "name": "artifact-boundary",
              "passed": false
            }
          ],
          "validator": "deterministic_text_checks"
        },
        {
          "content_excerpt": "**Fail\u2011Closed Recovery Sequence \u2013 \u201cProof\u2011Missing\u201d in a Strict\u2011Mode Review**\n\n> **Goal:** Re\u2011establish a verifiable evidence buffer for the task that already sits in `needs_review` **without** disablin",
          "error": "reject-incomplete; capture-proof; strict-reapply",
          "id": "proof-buffer-recovery",
          "latency_ms": 1736.1078262329102,
          "status": "failed",
          "text_checks": [
            {
              "name": "reject-incomplete",
              "passed": false
            },
            {
              "name": "capture-proof",
              "passed": false
            },
            {
              "name": "strict-reapply",
              "passed": false
            }
          ],
          "validator": "deterministic_text_checks"
        },
        {
          "content_excerpt": "",
          "error": "timeout-alignment; persist-resume; reuse-pr; no-ci-bypass",
          "id": "resumable-ci-monitor",
          "latency_ms": 1724.5471477508545,
          "status": "failed",
          "text_checks": [
            {
              "name": "timeout-alignment",
              "passed": false
            },
            {
              "name": "persist-resume",
              "passed": false
            },
            {
              "name": "reuse-pr",
              "passed": false
            },
            {
              "name": "no-ci-bypass",
              "passed": false
            }
          ],
          "validator": "deterministic_text_checks"
        },
        {
          "content_excerpt": "",
          "error": "backup-first; remote-target; preserve-untracked; verify-identical",
          "id": "local-remote-main-reconciliation",
          "latency_ms": 1727.7851104736328,
          "status": "failed",
          "text_checks": [
            {
              "name": "backup-first",
              "passed": false
            },
            {
              "name": "remote-target",
              "passed": false
            },
            {
              "name": "preserve-untracked",
              "passed": false
            },
            {
              "name": "verify-identical",
              "passed": false
            }
          ],
          "validator": "deterministic_text_checks"
        }
      ],
      "date": "2026-07-12",
      "source": "docs/findings/2026-07-12-qwen35-122b-mxfp4-evidence/planning-milestone-execution.suite.json",
      "status": "failed",
      "work_class": "planning"
    }
  },
  "thinking": {
    "chat_template_kwargs": {
      "enable_thinking": false
    },
    "mode": "disabled",
    "unsupported": false
  },
  "timing": {
    "chat": {
      "e2e_p50_ms": 0.0,
      "e2e_p95_ms": 0.0,
      "output_tokens": 0,
      "ttft_p50_ms": 0.0,
      "ttft_p95_ms": 0.0
    },
    "wall_ms": 8746.174335479736
  },
  "tool": {
    "checks": [],
    "status": "not_run"
  },
  "voice": {
    "llm_latency_ms": null,
    "status": "not_run",
    "stt_latency_ms": null,
    "total_turn_latency_ms": null,
    "tts_latency_ms": null
  }
}
