{
  "base_url": "http://127.0.0.1:39052/v1",
  "completed": 12,
  "concurrency": 1,
  "context_distribution": {
    "32768": 12
  },
  "context_seed": 0,
  "context_tokens": 32768,
  "engine": "nvidia-vllm-0.22.1",
  "failed": 0,
  "failures": [],
  "finished_at": "2026-08-01T12:52:39Z",
  "gpu": "dual-rtx-pro-6000-blackwell-max-q-tp2-pcie",
  "manifest": null,
  "max_context_tokens": 65536,
  "max_tokens": 256,
  "measurement_protocol": "capacity-v3",
  "metrics": {
    "content_chunks": 812,
    "content_chunks_s": null,
    "decode_tok_s_p50": 59.54294241969066,
    "decode_tok_s_p95": 60.34288551626709,
    "e2e_p50_ms": 3884.365500000058,
    "e2e_p95_ms": 4279.553099999248,
    "effective_prefill_tok_s_p50": 10024.728250705628,
    "effective_prefill_tok_s_p95": 10067.848854467644,
    "generation_p50_ms": 1055.6341000010434,
    "generation_p95_ms": 1437.1176999993622,
    "mean_inter_token_latency_ms_p50": 16.7748118421131,
    "mean_inter_token_latency_ms_p95": 16.907267058816025,
    "output_token_sources": {
      "usage": 12
    },
    "output_tokens": 824,
    "prefix_cache_hit_avg": null,
    "prompt_token_samples": 12,
    "prompt_tokens": 341248,
    "prompt_tokens_p50": 28438.0,
    "prompt_tokens_p95": 28448.0,
    "throughput_tok_s": 17.194878805840872,
    "ttft_p50_ms": 2835.987099999329,
    "ttft_p95_ms": 3079.747199999474,
    "ttft_samples": 12
  },
  "model": "nemotron3-super-120b-a12b-nvfp4-tp2",
  "request_timings": [
    {
      "decode_tok_s": 59.650799035369694,
      "e2e_ms": 3850.902000000133,
      "effective_prefill_tok_s": 9229.978356666694,
      "generation_ms": 771.1548000006587,
      "mean_inter_token_latency_ms": 16.764234782623017,
      "output_token_source": "usage",
      "output_tokens": 47,
      "planned_context_tokens": 32768,
      "prompt_tokens": 28426,
      "request_index": 0,
      "ttft_ms": 3079.747199999474
    },
    {
      "decode_tok_s": 59.61318728413418,
      "e2e_ms": 4120.984600000156,
      "effective_prefill_tok_s": 9988.409046503755,
      "generation_ms": 1274.8857000005955,
      "mean_inter_token_latency_ms": 16.7748118421131,
      "output_token_source": "usage",
      "output_tokens": 77,
      "planned_context_tokens": 32768,
      "prompt_tokens": 28428,
      "request_index": 1,
      "ttft_ms": 2846.0988999995607
    },
    {
      "decode_tok_s": 59.799609117793516,
      "e2e_ms": 4090.1759000007587,
      "effective_prefill_tok_s": 10024.728250705628,
      "generation_ms": 1254.1888000014296,
      "mean_inter_token_latency_ms": 16.722517333352396,
      "output_token_source": "usage",
      "output_tokens": 76,
      "planned_context_tokens": 32768,
      "prompt_tokens": 28430,
      "request_index": 2,
      "ttft_ms": 2835.987099999329
    },
    {
      "decode_tok_s": 59.28947493234347,
      "e2e_ms": 3871.9927000001917,
      "effective_prefill_tok_s": 10060.23509594724,
      "generation_ms": 1045.7168000011734,
      "mean_inter_token_latency_ms": 16.866400000018924,
      "output_token_source": "usage",
      "output_tokens": 63,
      "planned_context_tokens": 32768,
      "prompt_tokens": 28433,
      "request_index": 3,
      "ttft_ms": 2826.2758999990183
    },
    {
      "decode_tok_s": 59.67976972318129,
      "e2e_ms": 3884.365500000058,
      "effective_prefill_tok_s": 10052.209269501482,
      "generation_ms": 1055.6341000010434,
      "mean_inter_token_latency_ms": 16.756096825413387,
      "output_token_source": "usage",
      "output_tokens": 64,
      "planned_context_tokens": 32768,
      "prompt_tokens": 28435,
      "request_index": 4,
      "ttft_ms": 2828.7313999990147
    },
    {
      "decode_tok_s": 60.34288551626709,
      "e2e_ms": 3875.6337000013446,
      "effective_prefill_tok_s": 10043.084826842998,
      "generation_ms": 1044.0336000010575,
      "mean_inter_token_latency_ms": 16.57196190477869,
      "output_token_source": "usage",
      "output_tokens": 64,
      "planned_context_tokens": 32768,
      "prompt_tokens": 28438,
      "request_index": 5,
      "ttft_ms": 2831.600100000287
    },
    {
      "decode_tok_s": 59.248830367939895,
      "e2e_ms": 3904.9245999995037,
      "effective_prefill_tok_s": 10067.848854467644,
      "generation_ms": 1080.1900999995269,
      "mean_inter_token_latency_ms": 16.877970312492607,
      "output_token_source": "usage",
      "output_tokens": 65,
      "planned_context_tokens": 32768,
      "prompt_tokens": 28439,
      "request_index": 6,
      "ttft_ms": 2824.734499999977
    },
    {
      "decode_tok_s": 59.197702205102345,
      "e2e_ms": 4220.601400000305,
      "effective_prefill_tok_s": 10030.639280878773,
      "generation_ms": 1385.1888999997755,
      "mean_inter_token_latency_ms": 16.892547560972872,
      "output_token_source": "usage",
      "output_tokens": 83,
      "planned_context_tokens": 32768,
      "prompt_tokens": 28441,
      "request_index": 7,
      "ttft_ms": 2835.4125000005297
    },
    {
      "decode_tok_s": 59.269173577647756,
      "e2e_ms": 4169.125300000815,
      "effective_prefill_tok_s": 10027.41920919727,
      "generation_ms": 1332.9020000001037,
      "mean_inter_token_latency_ms": 16.872177215191186,
      "output_token_source": "usage",
      "output_tokens": 80,
      "planned_context_tokens": 32768,
      "prompt_tokens": 28440,
      "request_index": 8,
      "ttft_ms": 2836.223300000711
    },
    {
      "decode_tok_s": 59.14616457652544,
      "e2e_ms": 4279.553099999248,
      "effective_prefill_tok_s": 10006.559867640666,
      "generation_ms": 1437.1176999993622,
      "mean_inter_token_latency_ms": 16.907267058816025,
      "output_token_source": "usage",
      "output_tokens": 86,
      "planned_context_tokens": 32768,
      "prompt_tokens": 28443,
      "request_index": 9,
      "ttft_ms": 2842.4353999998857
    },
    {
      "decode_tok_s": 60.02714490678621,
      "e2e_ms": 3794.255799999519,
      "effective_prefill_tok_s": 10000.051323779302,
      "generation_ms": 949.5704000000842,
      "mean_inter_token_latency_ms": 16.659129824562882,
      "output_token_source": "usage",
      "output_tokens": 58,
      "planned_context_tokens": 32768,
      "prompt_tokens": 28447,
      "request_index": 10,
      "ttft_ms": 2844.6853999994346
    },
    {
      "decode_tok_s": 59.54294241969066,
      "e2e_ms": 3852.1844999995665,
      "effective_prefill_tok_s": 10001.025133202136,
      "generation_ms": 1007.676100000026,
      "mean_inter_token_latency_ms": 16.794601666667102,
      "output_token_source": "usage",
      "output_tokens": 61,
      "planned_context_tokens": 32768,
      "prompt_tokens": 28448,
      "request_index": 11,
      "ttft_ms": 2844.5083999995404
    }
  ],
  "requests": 12,
  "run_id": "benchmark-20260801T125151Z",
  "schema": "anvil-serving.benchmark/v1",
  "serve_flags": {
    "no_thinking": false,
    "reasoning_effort": null,
    "shared_prefix_burst": false,
    "thinking_mode": "disabled"
  },
  "source_recipe": null,
  "started_at": "2026-08-01T12:51:51Z",
  "tier": null,
  "timing_methodology": {
    "clock": "client time.perf_counter",
    "decode": "usage completion tokens after the first token divided by client-observed generation time",
    "effective_prefill": "usage.prompt_tokens divided by client-observed TTFT; includes queueing, scheduling, prefill, and first-token work",
    "generation": "client-observed E2E minus TTFT",
    "mean_inter_token_latency": "client-observed generation time divided by completion tokens after the first token; not a raw per-token timestamp trace",
    "ttft": "request start through the first non-empty streamed content delta"
  },
  "wall_clock_ms": 47921.244999999544
}
