{
  "base_url": "http://127.0.0.1:39054/v1",
  "completed": 12,
  "concurrency": 1,
  "context_distribution": {
    "32768": 12
  },
  "context_seed": 0,
  "context_tokens": 32768,
  "engine": "vllm-0.25.1",
  "failed": 0,
  "failures": [],
  "finished_at": "2026-08-01T13:05:20Z",
  "gpu": "dual-rtx-pro-6000-blackwell-max-q-tp2-pcie",
  "manifest": null,
  "max_context_tokens": 262144,
  "max_tokens": 256,
  "measurement_protocol": "capacity-v3",
  "metrics": {
    "content_chunks": 719,
    "content_chunks_s": null,
    "decode_tok_s_p50": 70.89472080462212,
    "decode_tok_s_p95": 72.0497529371927,
    "e2e_p50_ms": 2764.4951999991463,
    "e2e_p95_ms": 3402.721099999326,
    "effective_prefill_tok_s_p50": 15133.5958776311,
    "effective_prefill_tok_s_p95": 15192.231466030082,
    "generation_p50_ms": 784.4522000013967,
    "generation_p95_ms": 1139.8694999988948,
    "mean_inter_token_latency_ms_p50": 14.104324657550123,
    "mean_inter_token_latency_ms_p95": 14.248368749986184,
    "output_token_sources": {
      "usage": 12
    },
    "output_tokens": 731,
    "prefix_cache_hit_avg": null,
    "prompt_token_samples": 12,
    "prompt_tokens": 357997,
    "prompt_tokens_p50": 29834.0,
    "prompt_tokens_p95": 29843.0,
    "throughput_tok_s": 21.136579027855905,
    "ttft_p50_ms": 1971.0451000009925,
    "ttft_p95_ms": 2757.164199998442,
    "ttft_samples": 12
  },
  "model": "laguna-s-2.1-nvfp4-tp2",
  "request_timings": [
    {
      "decode_tok_s": 71.25630598935126,
      "e2e_ms": 3402.721099999326,
      "effective_prefill_tok_s": 10816.185702692952,
      "generation_ms": 645.5569000008836,
      "mean_inter_token_latency_ms": 14.033845652193122,
      "output_token_source": "usage",
      "output_tokens": 47,
      "planned_context_tokens": 32768,
      "prompt_tokens": 29822,
      "request_index": 0,
      "ttft_ms": 2757.164199998442
    },
    {
      "decode_tok_s": 72.0497529371927,
      "e2e_ms": 2710.213100001056,
      "effective_prefill_tok_s": 15103.739710060012,
      "generation_ms": 735.6028000012884,
      "mean_inter_token_latency_ms": 13.879298113231856,
      "output_token_source": "usage",
      "output_tokens": 54,
      "planned_context_tokens": 32768,
      "prompt_tokens": 29824,
      "request_index": 1,
      "ttft_ms": 1974.6102999997674
    },
    {
      "decode_tok_s": 70.80629786623889,
      "e2e_ms": 2764.4951999991463,
      "effective_prefill_tok_s": 15112.445747125506,
      "generation_ms": 790.8900999991602,
      "mean_inter_token_latency_ms": 14.123037499985003,
      "output_token_source": "usage",
      "output_tokens": 57,
      "planned_context_tokens": 32768,
      "prompt_tokens": 29826,
      "request_index": 2,
      "ttft_ms": 1973.6050999999861
    },
    {
      "decode_tok_s": 71.22862250976517,
      "e2e_ms": 2729.167299999972,
      "effective_prefill_tok_s": 15133.5958776311,
      "generation_ms": 758.1221999989793,
      "mean_inter_token_latency_ms": 14.039299999981099,
      "output_token_source": "usage",
      "output_tokens": 55,
      "planned_context_tokens": 32768,
      "prompt_tokens": 29829,
      "request_index": 3,
      "ttft_ms": 1971.0451000009925
    },
    {
      "decode_tok_s": 70.74088800637179,
      "e2e_ms": 2715.8006000008754,
      "effective_prefill_tok_s": 15169.424192915545,
      "generation_ms": 749.2130999999063,
      "mean_inter_token_latency_ms": 14.136096226413326,
      "output_token_source": "usage",
      "output_tokens": 54,
      "planned_context_tokens": 32768,
      "prompt_tokens": 29832,
      "request_index": 4,
      "ttft_ms": 1966.5875000009692
    },
    {
      "decode_tok_s": 70.89472080462212,
      "e2e_ms": 2718.2886999999027,
      "effective_prefill_tok_s": 15138.773186981749,
      "generation_ms": 747.5873999992473,
      "mean_inter_token_latency_ms": 14.105422641495231,
      "output_token_source": "usage",
      "output_tokens": 54,
      "planned_context_tokens": 32768,
      "prompt_tokens": 29834,
      "request_index": 5,
      "ttft_ms": 1970.7013000006555
    },
    {
      "decode_tok_s": 70.36706492257625,
      "e2e_ms": 2894.9194999986503,
      "effective_prefill_tok_s": 15135.512681452115,
      "generation_ms": 923.7276000003476,
      "mean_inter_token_latency_ms": 14.211193846159194,
      "output_token_source": "usage",
      "output_tokens": 66,
      "planned_context_tokens": 32768,
      "prompt_tokens": 29835,
      "request_index": 6,
      "ttft_ms": 1971.1918999983027
    },
    {
      "decode_tok_s": 70.55697677463779,
      "e2e_ms": 2863.207999998849,
      "effective_prefill_tok_s": 15142.77480640459,
      "generation_ms": 892.8954000002705,
      "mean_inter_token_latency_ms": 14.17294285714715,
      "output_token_source": "usage",
      "output_tokens": 64,
      "planned_context_tokens": 32768,
      "prompt_tokens": 29836,
      "request_index": 7,
      "ttft_ms": 1970.3125999985787
    },
    {
      "decode_tok_s": 71.0430455114195,
      "e2e_ms": 2913.1833000010374,
      "effective_prefill_tok_s": 15144.46195461011,
      "generation_ms": 943.0902000003698,
      "mean_inter_token_latency_ms": 14.075973134333879,
      "output_token_source": "usage",
      "output_tokens": 68,
      "planned_context_tokens": 32768,
      "prompt_tokens": 29836,
      "request_index": 8,
      "ttft_ms": 1970.0931000006676
    },
    {
      "decode_tok_s": 70.90023976899131,
      "e2e_ms": 3001.571099999637,
      "effective_prefill_tok_s": 15131.17385921762,
      "generation_ms": 1029.615700001159,
      "mean_inter_token_latency_ms": 14.104324657550123,
      "output_token_source": "usage",
      "output_tokens": 74,
      "planned_context_tokens": 32768,
      "prompt_tokens": 29838,
      "request_index": 9,
      "ttft_ms": 1971.9553999984782
    },
    {
      "decode_tok_s": 70.18347275725648,
      "e2e_ms": 3104.16289999921,
      "effective_prefill_tok_s": 15192.231466030082,
      "generation_ms": 1139.8694999988948,
      "mean_inter_token_latency_ms": 14.248368749986184,
      "output_token_source": "usage",
      "output_tokens": 81,
      "planned_context_tokens": 32768,
      "prompt_tokens": 29842,
      "request_index": 10,
      "ttft_ms": 1964.2934000003152
    },
    {
      "decode_tok_s": 71.38739619813711,
      "e2e_ms": 2760.7134000008955,
      "effective_prefill_tok_s": 15100.736684000864,
      "generation_ms": 784.4522000013967,
      "mean_inter_token_latency_ms": 14.008075000024942,
      "output_token_source": "usage",
      "output_tokens": 57,
      "planned_context_tokens": 32768,
      "prompt_tokens": 29843,
      "request_index": 11,
      "ttft_ms": 1976.2611999994988
    }
  ],
  "requests": 12,
  "run_id": "benchmark-20260801T130445Z",
  "schema": "anvil-serving.benchmark/v1",
  "serve_flags": {
    "no_thinking": false,
    "reasoning_effort": null,
    "shared_prefix_burst": false,
    "thinking_mode": "disabled"
  },
  "source_recipe": null,
  "started_at": "2026-08-01T13:04:45Z",
  "tier": null,
  "timing_methodology": {
    "clock": "client time.perf_counter",
    "decode": "usage completion tokens after the first token divided by client-observed generation time",
    "effective_prefill": "usage.prompt_tokens divided by client-observed TTFT; includes queueing, scheduling, prefill, and first-token work",
    "generation": "client-observed E2E minus TTFT",
    "mean_inter_token_latency": "client-observed generation time divided by completion tokens after the first token; not a raw per-token timestamp trace",
    "ttft": "request start through the first non-empty streamed content delta"
  },
  "wall_clock_ms": 34584.59380000022
}
