{
  "base_url": "http://127.0.0.1:30010/v1",
  "completed": 10,
  "concurrency": 1,
  "context_distribution": {
    "8192": 10
  },
  "context_seed": 0,
  "context_tokens": 8192,
  "engine": "vllm-f25953cc",
  "failed": 0,
  "failures": [],
  "finished_at": "2026-07-29T10:23:16Z",
  "gpu": "rtx-pro-6000",
  "manifest": null,
  "max_context_tokens": 262144,
  "max_tokens": 64,
  "measurement_protocol": "capacity-v3",
  "metrics": {
    "content_chunks": 613,
    "content_chunks_s": null,
    "decode_tok_s_p50": 188.05066383487437,
    "decode_tok_s_p95": 188.94520589098846,
    "e2e_p50_ms": 585.9610999978031,
    "e2e_p95_ms": 823.9948999980697,
    "effective_prefill_tok_s_p50": 29167.57038845815,
    "effective_prefill_tok_s_p95": 30405.84837948286,
    "generation_p50_ms": 334.1254000006302,
    "generation_p95_ms": 335.138200000074,
    "mean_inter_token_latency_ms_p50": 5.31704603175361,
    "mean_inter_token_latency_ms_p95": 5.32390363640099,
    "output_token_sources": {
      "usage": 10
    },
    "output_tokens": 616,
    "prefix_cache_hit_avg": null,
    "prompt_token_samples": 10,
    "prompt_tokens": 73525,
    "prompt_tokens_p50": 7352.0,
    "prompt_tokens_p95": 7356.0,
    "throughput_tok_s": 102.60222391981729,
    "ttft_p50_ms": 252.01580000066315,
    "ttft_p95_ms": 531.2477999978,
    "ttft_samples": 10
  },
  "model": "agents-a1-fp8-mm-262k",
  "request_timings": [
    {
      "decode_tok_s": 187.8754734033209,
      "e2e_ms": 823.9948999980697,
      "effective_prefill_tok_s": 13835.351412336084,
      "generation_ms": 292.7471000002697,
      "mean_inter_token_latency_ms": 5.322674545459449,
      "output_token_source": "usage",
      "output_tokens": 56,
      "planned_context_tokens": 8192,
      "prompt_tokens": 7350,
      "request_index": 0,
      "ttft_ms": 531.2477999978
    },
    {
      "decode_tok_s": 188.85086309906814,
      "e2e_ms": 534.1403999991599,
      "effective_prefill_tok_s": 30258.705759267224,
      "generation_ms": 291.23510000135866,
      "mean_inter_token_latency_ms": 5.295183636388339,
      "output_token_source": "usage",
      "output_tokens": 56,
      "planned_context_tokens": 8192,
      "prompt_tokens": 7350,
      "request_index": 1,
      "ttft_ms": 242.9052999978012
    },
    {
      "decode_tok_s": 187.98215184060214,
      "e2e_ms": 588.7438000027032,
      "effective_prefill_tok_s": 28982.009860680522,
      "generation_ms": 335.138200000074,
      "mean_inter_token_latency_ms": 5.3196539682551425,
      "output_token_source": "usage",
      "output_tokens": 64,
      "planned_context_tokens": 8192,
      "prompt_tokens": 7350,
      "request_index": 2,
      "ttft_ms": 253.60560000262922
    },
    {
      "decode_tok_s": 188.0743544494368,
      "e2e_ms": 576.7366000000038,
      "effective_prefill_tok_s": 30405.84837948286,
      "generation_ms": 334.97390000047744,
      "mean_inter_token_latency_ms": 5.31704603175361,
      "output_token_source": "usage",
      "output_tokens": 64,
      "planned_context_tokens": 8192,
      "prompt_tokens": 7351,
      "request_index": 3,
      "ttft_ms": 241.76269999952638
    },
    {
      "decode_tok_s": 188.5519628255774,
      "e2e_ms": 585.9610999978031,
      "effective_prefill_tok_s": 29193.636962839395,
      "generation_ms": 334.1254000006302,
      "mean_inter_token_latency_ms": 5.303577777787781,
      "output_token_source": "usage",
      "output_tokens": 64,
      "planned_context_tokens": 8192,
      "prompt_tokens": 7352,
      "request_index": 4,
      "ttft_ms": 251.83569999717292
    },
    {
      "decode_tok_s": 188.94520589098846,
      "e2e_ms": 585.4457999994338,
      "effective_prefill_tok_s": 29176.7420930777,
      "generation_ms": 333.42999999877065,
      "mean_inter_token_latency_ms": 5.292539682520169,
      "output_token_source": "usage",
      "output_tokens": 64,
      "planned_context_tokens": 8192,
      "prompt_tokens": 7353,
      "request_index": 5,
      "ttft_ms": 252.01580000066315
    },
    {
      "decode_tok_s": 188.05066383487437,
      "e2e_ms": 587.3948000007658,
      "effective_prefill_tok_s": 29134.78831581374,
      "generation_ms": 335.01609999802895,
      "mean_inter_token_latency_ms": 5.317715872984587,
      "output_token_source": "usage",
      "output_tokens": 64,
      "planned_context_tokens": 8192,
      "prompt_tokens": 7353,
      "request_index": 6,
      "ttft_ms": 252.37870000273688
    },
    {
      "decode_tok_s": 188.02770871808704,
      "e2e_ms": 586.6184000005887,
      "effective_prefill_tok_s": 29233.41975354572,
      "generation_ms": 335.05700000023353,
      "mean_inter_token_latency_ms": 5.318365079368786,
      "output_token_source": "usage",
      "output_tokens": 64,
      "planned_context_tokens": 8192,
      "prompt_tokens": 7354,
      "request_index": 7,
      "ttft_ms": 251.5614000003552
    },
    {
      "decode_tok_s": 187.83209995814454,
      "e2e_ms": 545.6867000029888,
      "effective_prefill_tok_s": 29089.81619148352,
      "generation_ms": 292.81470000205445,
      "mean_inter_token_latency_ms": 5.32390363640099,
      "output_token_source": "usage",
      "output_tokens": 56,
      "planned_context_tokens": 8192,
      "prompt_tokens": 7356,
      "request_index": 8,
      "ttft_ms": 252.87200000093435
    },
    {
      "decode_tok_s": 188.24001857281397,
      "e2e_ms": 586.8769999979122,
      "effective_prefill_tok_s": 29167.57038845815,
      "generation_ms": 334.6791000003577,
      "mean_inter_token_latency_ms": 5.312366666672345,
      "output_token_source": "usage",
      "output_tokens": 64,
      "planned_context_tokens": 8192,
      "prompt_tokens": 7356,
      "request_index": 9,
      "ttft_ms": 252.1978999975545
    }
  ],
  "requests": 10,
  "run_id": "benchmark-20260729T102310Z",
  "schema": "anvil-serving.benchmark/v1",
  "serve_flags": {
    "no_thinking": false,
    "reasoning_effort": null,
    "shared_prefix_burst": false,
    "thinking_mode": "disabled"
  },
  "source_recipe": null,
  "started_at": "2026-07-29T10:23:10Z",
  "tier": null,
  "timing_methodology": {
    "clock": "client time.perf_counter",
    "decode": "usage completion tokens after the first token divided by client-observed generation time",
    "effective_prefill": "usage.prompt_tokens divided by client-observed TTFT; includes queueing, scheduling, prefill, and first-token work",
    "generation": "client-observed E2E minus TTFT",
    "mean_inter_token_latency": "client-observed generation time divided by completion tokens after the first token; not a raw per-token timestamp trace",
    "ttft": "request start through the first non-empty streamed content delta"
  },
  "wall_clock_ms": 6003.768500002479
}
