{
  "base_url": "http://127.0.0.1:39038/v1",
  "completed": 10,
  "concurrency": 1,
  "context_distribution": {
    "4096": 10
  },
  "context_seed": 0,
  "context_tokens": 4096,
  "engine": "sglang",
  "failed": 0,
  "failures": [],
  "finished_at": "2026-08-21T14:49:10Z",
  "gpu": "rtx-5090",
  "manifest": null,
  "max_context_tokens": 131072,
  "max_tokens": 256,
  "measurement_protocol": "capacity-v3",
  "metrics": {
    "content_chunks": 165,
    "content_chunks_s": null,
    "decode_tok_s_p50": 138.18709037549667,
    "decode_tok_s_p95": 151.33726653225116,
    "e2e_p50_ms": 664.3758000573143,
    "e2e_p95_ms": 747.0614000922069,
    "effective_prefill_tok_s_p50": 10447.093986072548,
    "effective_prefill_tok_s_p95": 10487.59934921711,
    "generation_p50_ms": 318.2531000347808,
    "generation_p95_ms": 382.0532000390813,
    "mean_inter_token_latency_ms_p50": 7.0722911118840175,
    "mean_inter_token_latency_ms_p95": 8.128791490193219,
    "output_token_sources": {
      "usage": 10
    },
    "output_tokens": 461,
    "prefix_cache_hit_avg": null,
    "prompt_token_samples": 10,
    "prompt_tokens": 36130,
    "prompt_tokens_p50": 3613.0,
    "prompt_tokens_p95": 3613.0,
    "reasoning_chunks": 0,
    "throughput_tok_s": 67.88809373669967,
    "time_to_first_output_p50_ms": 345.3162000514567,
    "time_to_first_output_p95_ms": 374.03369997628033,
    "ttft_p50_ms": 345.3168000560254,
    "ttft_p95_ms": 374.0345999831334,
    "ttft_samples": 10
  },
  "model": "qwen38-27b-radixark-nvfp4-sglang-rtx5090-128k-mm",
  "request_timings": [
    {
      "content_chunks": 16,
      "decode_tok_s": 135.20405435012302,
      "e2e_ms": 692.0715000014752,
      "effective_prefill_tok_s": 9659.557414824176,
      "generation_ms": 318.0378000251949,
      "mean_inter_token_latency_ms": 7.396227907562672,
      "output_token_source": "usage",
      "output_tokens": 44,
      "planned_context_tokens": 4096,
      "prompt_tokens": 3613,
      "reasoning_chunks": 0,
      "request_index": 0,
      "time_to_first_output_ms": 374.03369997628033,
      "ttft_ms": 374.0345999831334,
      "visible_generation_ms": 318.03690001834184
    },
    {
      "content_chunks": 19,
      "decode_tok_s": 123.01951664111762,
      "e2e_ms": 747.0614000922069,
      "effective_prefill_tok_s": 9898.407760357552,
      "generation_ms": 382.0532000390813,
      "mean_inter_token_latency_ms": 8.128791490193219,
      "output_token_source": "usage",
      "output_tokens": 48,
      "planned_context_tokens": 4096,
      "prompt_tokens": 3613,
      "reasoning_chunks": 0,
      "request_index": 1,
      "time_to_first_output_ms": 365.0082000531256,
      "ttft_ms": 365.00890005845577,
      "visible_generation_ms": 382.05250003375113
    },
    {
      "content_chunks": 17,
      "decode_tok_s": 141.80102068307238,
      "e2e_ms": 683.8149999966845,
      "effective_prefill_tok_s": 10462.98642463389,
      "generation_ms": 338.5024999734014,
      "mean_inter_token_latency_ms": 7.05213541611253,
      "output_token_source": "usage",
      "output_tokens": 49,
      "planned_context_tokens": 4096,
      "prompt_tokens": 3613,
      "reasoning_chunks": 0,
      "request_index": 2,
      "time_to_first_output_ms": 345.31250002328306,
      "ttft_ms": 345.31310002785176,
      "visible_generation_ms": 338.50189996883273
    },
    {
      "content_chunks": 15,
      "decode_tok_s": 142.36371219000713,
      "e2e_ms": 641.6056000161916,
      "effective_prefill_tok_s": 10424.523046618422,
      "generation_ms": 295.01899995375425,
      "mean_inter_token_latency_ms": 7.024261903660816,
      "output_token_source": "usage",
      "output_tokens": 43,
      "planned_context_tokens": 4096,
      "prompt_tokens": 3613,
      "reasoning_chunks": 0,
      "request_index": 3,
      "time_to_first_output_ms": 346.58660006243736,
      "ttft_ms": 346.58720006700605,
      "visible_generation_ms": 295.01839994918555
    },
    {
      "content_chunks": 15,
      "decode_tok_s": 145.21517680313963,
      "e2e_ms": 641.2627999670804,
      "effective_prefill_tok_s": 10467.89733893676,
      "generation_ms": 296.112300013192,
      "mean_inter_token_latency_ms": 6.886332558446326,
      "output_token_source": "usage",
      "output_tokens": 44,
      "planned_context_tokens": 4096,
      "prompt_tokens": 3613,
      "reasoning_chunks": 0,
      "request_index": 4,
      "time_to_first_output_ms": 345.15049995388836,
      "ttft_ms": 345.15109995845705,
      "visible_generation_ms": 296.1117000086233
    },
    {
      "content_chunks": 16,
      "decode_tok_s": 141.3968944688429,
      "e2e_ms": 664.3758000573143,
      "effective_prefill_tok_s": 10438.49478744036,
      "generation_ms": 318.2531000347808,
      "mean_inter_token_latency_ms": 7.0722911118840175,
      "output_token_source": "usage",
      "output_tokens": 46,
      "planned_context_tokens": 4096,
      "prompt_tokens": 3613,
      "reasoning_chunks": 0,
      "request_index": 5,
      "time_to_first_output_ms": 346.12270002253354,
      "ttft_ms": 346.1232000263408,
      "visible_generation_ms": 318.25260003097355
    },
    {
      "content_chunks": 18,
      "decode_tok_s": 133.412157684558,
      "e2e_ms": 705.0340999849141,
      "effective_prefill_tok_s": 10464.977517875752,
      "generation_ms": 359.7872999962419,
      "mean_inter_token_latency_ms": 7.4955687499217065,
      "output_token_source": "usage",
      "output_tokens": 49,
      "planned_context_tokens": 4096,
      "prompt_tokens": 3613,
      "reasoning_chunks": 0,
      "request_index": 6,
      "time_to_first_output_ms": 345.24679998867214,
      "ttft_ms": 345.24739999324083,
      "visible_generation_ms": 359.78669999167323
    },
    {
      "content_chunks": 16,
      "decode_tok_s": 125.67143894715517,
      "e2e_ms": 663.6065000202507,
      "effective_prefill_tok_s": 10462.87431479211,
      "generation_ms": 318.290299968794,
      "mean_inter_token_latency_ms": 7.95725749921985,
      "output_token_source": "usage",
      "output_tokens": 41,
      "planned_context_tokens": 4096,
      "prompt_tokens": 3613,
      "reasoning_chunks": 0,
      "request_index": 7,
      "time_to_first_output_ms": 345.3162000514567,
      "ttft_ms": 345.3168000560254,
      "visible_generation_ms": 318.2896999642253
    },
    {
      "content_chunks": 18,
      "decode_tok_s": 138.18709037549667,
      "e2e_ms": 706.3304000766948,
      "effective_prefill_tok_s": 10487.59934921711,
      "generation_ms": 361.8283000541851,
      "mean_inter_token_latency_ms": 7.236566001083702,
      "output_token_source": "usage",
      "output_tokens": 51,
      "planned_context_tokens": 4096,
      "prompt_tokens": 3613,
      "reasoning_chunks": 0,
      "request_index": 8,
      "time_to_first_output_ms": 344.5021000225097,
      "ttft_ms": 344.5025000255555,
      "visible_generation_ms": 361.8279000511393
    },
    {
      "content_chunks": 15,
      "decode_tok_s": 151.33726653225116,
      "e2e_ms": 643.1868999497965,
      "effective_prefill_tok_s": 10447.093986072548,
      "generation_ms": 297.34910000115633,
      "mean_inter_token_latency_ms": 6.607757777803474,
      "output_token_source": "usage",
      "output_tokens": 46,
      "planned_context_tokens": 4096,
      "prompt_tokens": 3613,
      "reasoning_chunks": 0,
      "request_index": 9,
      "time_to_first_output_ms": 345.83779994864017,
      "ttft_ms": 345.83839995320886,
      "visible_generation_ms": 297.34849999658763
    }
  ],
  "requests": 10,
  "run_id": "benchmark-20260821T144904Z",
  "schema": "anvil-serving.benchmark/v1",
  "serve_flags": {
    "no_thinking": false,
    "reasoning_effort": null,
    "shared_prefix_burst": false,
    "thinking_mode": "disabled"
  },
  "source_recipe": null,
  "started_at": "2026-08-21T14:49:04Z",
  "tier": null,
  "timing_methodology": {
    "clock": "client time.perf_counter",
    "decode": "usage completion tokens after the first token divided by client-observed generation time; completion tokens may include reasoning tokens",
    "effective_prefill": "usage.prompt_tokens divided by client-observed time to first output; includes queueing, scheduling, prefill, and first-token work",
    "generation": "client-observed E2E minus time to first output",
    "mean_inter_token_latency": "client-observed generation time divided by completion tokens after the first token; not a raw per-token timestamp trace",
    "time_to_first_output": "request start through the first non-empty streamed reasoning or content delta",
    "ttft": "request start through the first non-empty streamed content delta"
  },
  "wall_clock_ms": 6790.586900082417
}
