Executive forecast
Base horizon median
960.000
human-expert minutes
Base 80% interval
960.000–960.000
Model, residual and scenario uncertainty
Recent annualized pace
1154.0%
Log-interpolated six-month window
Recalculate
2026-08-27
Earlier if a trigger fires
Decision implication. Use the result as a benchmark-trajectory demonstration only; do not convert it directly into autonomous economic output.
Compact Canonical Model
Ys(t) = Bs(t) min { Q0 exp[∫0t gQ,s(u)du], Ms(t)Ds(t)Us(t) }Realized output is limited by technical capacity and absorptive demand, with branch-specific and transfer constraints applied exactly once.
Generalized realization family
Y = BX[ α(BQQ)−ρ + (1−α)(BZZ)−ρ ]−1/ρAs ρ → ∞, the generalized family converges to the compact hard minimum.
Scenario forecast
| Scenario | Probability | Horizon median | 80% interval | Assumptions |
|---|---|---|---|---|
| Base | 58.0% | 960.000 | 960.000 – 960.000 | Model-averaged historical dynamics continue within the benchmark definition. |
| Accelerated | 20.0% | 960.000 | 960.000 – 960.000 | Recent acceleration persists. |
| Saturation / measurement stress | 17.0% | 960.000 | 960.000 – 960.000 | Benchmark saturation or measurement limitations dominate. |
| Discontinuous | 5.0% | 960.000 | 960.000 – 960.000 | A structural improvement loop materially changes the trajectory. |
Current pace
Current
719.000
6 months ago
201.111
12 months ago
54.444
Log-growth acceleration
-0.216
per year²
Rates use log interpolation at six- and twelve-month anchors.
Model competition
| Model | Converged | AICc | Log RMSE | Horizon prediction |
|---|---|---|---|---|
| change_point | Yes | 19.108 | 0.247 | 5,967.8 |
| accelerating | Yes | 21.956 | 0.341 | 4,574.9 |
| decaying_acceleration | Yes | 27.533 | 0.342 | 4,571.1 |
| exponential | Yes | 34.660 | 0.658 | 888.718 |
| logistic | Yes | 38.993 | 0.658 | 888.716 |
| linear | Yes | 64.217 | 2.050 | 44.126 |
Milestones
| Milestone | Scenario | Probability | Median crossing | Early 10% | Late 90% |
|---|---|---|---|---|---|
| Published approximate 16-hour reliability boundary | base | 100.0% | 2026-07-28 | 2026-07-28 | 2026-07-28 |
| Published approximate 16-hour reliability boundary | accelerated | 100.0% | 2026-07-28 | 2026-07-28 | 2026-07-28 |
| Published approximate 16-hour reliability boundary | downside | 100.0% | 2026-07-28 | 2026-07-28 | 2026-07-28 |
| Published approximate 16-hour reliability boundary | discontinuous | 100.0% | 2026-07-28 | 2026-07-28 | 2026-07-28 |
Bottlenecks
| Constraint | Severity | Mechanism | Release condition | Mitigation |
|---|---|---|---|---|
| Benchmark measurement range | critical | The published task suite becomes unreliable above approximately 16 hours. | A validated harder task suite extends the measurable range. | Treat 960 minutes as a measurement boundary, not a capability ceiling. |
Trigger dashboard
| Trigger | Direction | Threshold | Forecast effect | Action |
|---|---|---|---|---|
| New official METR release | event | New version or measurement | Changes the evidence clock and possibly the measurement regime. | Recalculate immediately with frozen upstream data. |
Optimal plan for today’s regime
no regret actions
Freeze source snapshots and record benchmark/configuration changes.; Use rolling-origin scores rather than in-sample fit alone.
option preserving actions
Maintain multiple model classes and trigger-based recalibration.
next experiment
Add the complete upstream dataset and rerun the preregistered hindcast.
delay pending evidence
Do not translate benchmark movement directly into revenue or deployment.
stop expand pivot
Expand confidence only after independent replication and prospective calibration.
Evidence ledger
| ID | Evidence | Grade | Measurement date | Publisher |
|---|---|---|---|---|
| metr-time-horizon-1-1 | Task-Completion Time Horizons of Frontier AI Models, version 1.1 | A | 2026-05-08 | METR |
| metr-transcribed-excerpt | FWAA METR public excerpt | B | 2026-05-08 | MONTREAL.AI |
Confidence and limitations
Evidence quality score
0.900
Model disagreement
1.694
Base p80 relative width
0.0%
Boundary. Research and decision-support output only. No warranty, assurance, legal, investment, tax, medical, or regulatory advice is provided.
Reproducibility
Input SHA-256
66d5512cf0a512703783ec08df4d22e1123b7570b1f64ef4cbac1d288ade86ea
Seed
20260728
Bootstrap samples
100
Open complete machine-readable result
{
"protocol_version": "2.0.0",
"engine_version": "2.0.0",
"forecast_id": "metr-time-horizon-demonstration-2026-07-28",
"generated_at": "2026-07-28T16:00:00+00:00",
"research_cutoff": "2026-07-28T18:00:00+00:00",
"target": {
"question": "What trajectory is implied for the measurable p50 task-completion horizon within the published METR Time Horizon 1.1 reliability range?",
"metric": "METR p50 task-completion horizon",
"unit": "human-expert minutes",
"scope": "METR Time Horizon 1.1 excerpt",
"horizon_end": "2026-12-31",
"target_kind": "technical_capability",
"success_definition": "The p50 horizon is the task duration at which the evaluated system succeeds with 50% probability under the specified benchmark methodology.",
"direction": "higher_is_better",
"lower_bound": 0,
"upper_bound": 960
},
"executive_forecast": {
"base_horizon_median": 960.0,
"base_horizon_p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"decision_implication": "Use the result as a benchmark-trajectory demonstration only; do not convert it directly into autonomous economic output.",
"validation_status": "Probabilistic reference forecast; not a guarantee or assurance engagement."
},
"observations": [
{
"date": "2019-02-14",
"value": 0.05,
"evidence_ids": [
"metr-time-horizon-1-1",
"metr-transcribed-excerpt"
],
"comparable": true,
"note": "TH 1.1 public chart/table transcription"
},
{
"date": "2020-05-28",
"value": 0.14,
"evidence_ids": [
"metr-time-horizon-1-1",
"metr-transcribed-excerpt"
],
"comparable": true,
"note": "TH 1.1 public chart/table transcription"
},
{
"date": "2022-03-15",
"value": 0.6,
"evidence_ids": [
"metr-time-horizon-1-1",
"metr-transcribed-excerpt"
],
"comparable": true,
"note": "TH 1.1 public chart/table transcription"
},
{
"date": "2023-03-14",
"value": 4.0,
"evidence_ids": [
"metr-time-horizon-1-1",
"metr-transcribed-excerpt"
],
"comparable": true,
"note": "TH 1.1 public chart/table transcription"
},
{
"date": "2024-05-13",
"value": 7.0,
"evidence_ids": [
"metr-time-horizon-1-1",
"metr-transcribed-excerpt"
],
"comparable": true,
"note": "TH 1.1 public chart/table transcription"
},
{
"date": "2024-10-22",
"value": 20.5,
"evidence_ids": [
"metr-time-horizon-1-1",
"metr-transcribed-excerpt"
],
"comparable": true,
"note": "TH 1.1 public chart/table transcription"
},
{
"date": "2024-12-05",
"value": 38.8,
"evidence_ids": [
"metr-time-horizon-1-1",
"metr-transcribed-excerpt"
],
"comparable": true,
"note": "TH 1.1 public chart/table transcription"
},
{
"date": "2025-02-24",
"value": 60.4,
"evidence_ids": [
"metr-time-horizon-1-1",
"metr-transcribed-excerpt"
],
"comparable": true,
"note": "TH 1.1 public chart/table transcription"
},
{
"date": "2025-04-16",
"value": 119.7,
"evidence_ids": [
"metr-time-horizon-1-1",
"metr-transcribed-excerpt"
],
"comparable": true,
"note": "TH 1.1 public chart/table transcription"
},
{
"date": "2025-08-07",
"value": 203.0,
"evidence_ids": [
"metr-time-horizon-1-1",
"metr-transcribed-excerpt"
],
"comparable": true,
"note": "TH 1.1 public chart/table transcription"
},
{
"date": "2025-11-24",
"value": 293.0,
"evidence_ids": [
"metr-time-horizon-1-1",
"metr-transcribed-excerpt"
],
"comparable": true,
"note": "TH 1.1 public chart/table transcription"
},
{
"date": "2025-12-11",
"value": 352.0,
"evidence_ids": [
"metr-time-horizon-1-1",
"metr-transcribed-excerpt"
],
"comparable": true,
"note": "TH 1.1 public chart/table transcription"
},
{
"date": "2026-02-05",
"value": 719.0,
"evidence_ids": [
"metr-time-horizon-1-1",
"metr-transcribed-excerpt"
],
"comparable": true,
"note": "TH 1.1 public chart/table transcription"
}
],
"evidence": [
{
"id": "metr-time-horizon-1-1",
"title": "Task-Completion Time Horizons of Frontier AI Models, version 1.1",
"publisher": "METR",
"source_url": "https://metr.org/time-horizons/",
"quality_grade": "A",
"measurement_date": "2026-05-08",
"publication_date": "2026-05-08",
"accessed_at": "2026-07-28T14:00:00-04:00",
"primary": true,
"claim": "Official methodology and public measurements; values above approximately 16 hours are flagged as unreliable.",
"license": null,
"sha256": null,
"notes": "Official upstream source is authoritative."
},
{
"id": "metr-transcribed-excerpt",
"title": "FWAA METR public excerpt",
"publisher": "MONTREAL.AI",
"source_url": "https://github.com/MontrealAI/forecasting-a-world-that-accelerates",
"quality_grade": "B",
"measurement_date": "2026-05-08",
"publication_date": "2026-07-28",
"accessed_at": "2026-07-28T14:00:00-04:00",
"primary": false,
"claim": "Hand-transcribed, source-linked excerpt for reproducible demonstration.",
"license": null,
"sha256": null,
"notes": "May contain transcription error; upstream source controls."
}
],
"current_pace": {
"anchor_dates": {
"current": "2026-02-05",
"six_months_ago": "2025-08-05",
"twelve_months_ago": "2025-02-05"
},
"anchor_values": {
"current": 719.0000000000002,
"six_months_ago": 201.11100093854776,
"twelve_months_ago": 54.44421811535221
},
"recent_continuous_growth": 2.5289159616964167,
"prior_continuous_growth": 2.636769032941542,
"annualized_recent_change": 11.539905028564826,
"annualized_prior_change": 12.96800047273713,
"log_growth_acceleration": -0.2158494541054668,
"recent_doubling_time_years": 0.274088657376727,
"note": "Rates use log interpolation at six- and twelve-month anchors."
},
"compact_canonical_model": {
"equation": "Y_s(t)=B_s(t) min{Q_0 exp[int_0^t g_Q,s(u) du], M_s(t)D_s(t)U_s(t)}",
"technical_growth_equation": "g_Q,s=beta_theta theta_dot-beta_c c_dot/c-beta_tau tau_dot/tau+beta_A A_dot/(A+epsilon)+beta_P P_dot/P+beta_R R_dot/R",
"generalized_family": "Y=B_X[alpha(B_Q Q)^(-rho)+(1-alpha)(B_Z Z)^(-rho)]^(-1/rho); rho->infinity yields the hard minimum.",
"configuration": {
"mode": "reduced_form",
"input_series_semantics": "realized_outcome"
},
"diagnostics": {
"base": {},
"accelerated": {},
"downside": {},
"discontinuous": {}
},
"plain_language": "Realized output is limited by technical capacity and absorptive demand, with branch-specific and transfer constraints applied exactly once."
},
"model_fit": {
"candidate_models": [
"linear",
"exponential",
"accelerating",
"decaying_acceleration",
"logistic",
"change_point"
],
"fits": [
{
"model": "linear",
"converged": true,
"parameters": {
"intercept": 0.048595593718133274,
"slope": 5.595733668199669,
"time_origin": 0.0
},
"n_observations": 13,
"n_parameters": 3,
"log_likelihood": -27.77518797081116,
"aicc": 64.21704260828899,
"bic": 63.24522401400693,
"rmse_log": 2.049537970751037,
"mae_log": 1.6806988451423865,
"horizon_prediction": 44.125957246347404,
"message": "Gaussian log-residual maximum likelihood: `ftol` termination condition is satisfied."
},
{
"model": "exponential",
"converged": true,
"parameters": {
"log_x0": -3.874330839255792,
"growth": 1.3538360591421965,
"time_origin": 0.0
},
"n_observations": 13,
"n_parameters": 3,
"log_likelihood": -12.996747710595953,
"aicc": 34.66016208785857,
"bic": 33.68834349357652,
"rmse_log": 0.6575800920712663,
"mae_log": 0.5635503562853404,
"horizon_prediction": 888.7176304743526,
"message": "Gaussian log-residual maximum likelihood (closed form)"
},
{
"model": "accelerating",
"converged": true,
"parameters": {
"log_x0": -2.7928813223472013,
"growth": 0.2851735695171765,
"acceleration": 0.2892967201838304,
"time_origin": 0.0
},
"n_observations": 13,
"n_parameters": 4,
"log_likelihood": -4.478106793133241,
"aicc": 21.956213586266482,
"bic": 19.21601101611263,
"rmse_log": 0.3414791076979788,
"mae_log": 0.26329416622198437,
"horizon_prediction": 4574.898693195833,
"message": "Gaussian log-residual maximum likelihood (closed form quadratic)"
},
{
"model": "decaying_acceleration",
"converged": true,
"parameters": {
"log_x0": -2.7928303761504667,
"growth": 0.2847203853750686,
"initial_acceleration": 0.2896671486540098,
"kappa": 0.00037325712326690276,
"time_origin": 0.0
},
"n_observations": 13,
"n_parameters": 5,
"log_likelihood": -4.480576281532016,
"aicc": 27.532581134492602,
"bic": 21.785899350371714,
"rmse_log": 0.34154398145142795,
"mae_log": 0.26335701778671067,
"horizon_prediction": 4571.114609150665,
"message": "`xtol` termination condition is satisfied."
},
{
"model": "logistic",
"converged": true,
"parameters": {
"x0": 0.02076822979180065,
"growth": 1.353836087489437,
"capacity": 485165902.8487187,
"time_origin": 0.0
},
"n_observations": 13,
"n_parameters": 4,
"log_likelihood": -12.996749749794587,
"aicc": 38.99349949958918,
"bic": 36.25329692943532,
"rmse_log": 0.6575801952202303,
"mae_log": 0.5635504589331967,
"horizon_prediction": 888.7161703060436,
"message": "`ftol` termination condition is satisfied."
},
{
"model": "change_point",
"converged": true,
"parameters": {
"log_x0": -3.1572399402605207,
"growth_pre": 1.0051577953256194,
"growth_delta": 1.493540746527712,
"change_time": 5.2430919183829925,
"time_origin": 0.0
},
"n_observations": 13,
"n_parameters": 5,
"log_likelihood": -0.2680683686127222,
"aicc": 19.107565308654017,
"bic": 13.360883524533127,
"rmse_log": 0.24701211636073386,
"mae_log": 0.21190103538713959,
"horizon_prediction": 5967.7977835230095,
"message": "Gaussian log-residual maximum likelihood with grid-searched continuous change point"
}
],
"base_model_weights": {
"linear": 1.2753513535751312e-10,
"exponential": 0.0003340603282997166,
"accelerating": 0.19162504502038066,
"decaying_acceleration": 0.011791238999204937,
"logistic": 3.826948699466806e-05,
"change_point": 0.7962113860375849
},
"horizon_log_disagreement": 1.6940806574243936,
"rolling_origin_hindcast": [
{
"model": "linear",
"n": 6,
"rmse_log": 2.7831508490414008,
"mae_log": 2.7727931563465744,
"smape": 1.7590990025793811
},
{
"model": "exponential",
"n": 6,
"rmse_log": 0.9629048070323964,
"mae_log": 0.9493991679490766,
"smape": 0.879380273507374
},
{
"model": "accelerating",
"n": 6,
"rmse_log": 0.44436229362027546,
"mae_log": 0.3763319707244672,
"smape": 0.36710753223640397
},
{
"model": "decaying_acceleration",
"n": 6,
"rmse_log": 0.44457452361353633,
"mae_log": 0.37659230437955893,
"smape": 0.36735648043270275
},
{
"model": "logistic",
"n": 6,
"rmse_log": 0.9629049610480146,
"mae_log": 0.949399320192505,
"smape": 0.8793803943124106
},
{
"model": "change_point",
"n": 6,
"rmse_log": 0.29153211270568286,
"mae_log": 0.2415770928505833,
"smape": 0.23868403922610715
},
{
"model": "model_average",
"n": 6,
"rmse_log": 0.6246605288625741,
"mae_log": 0.5065978264168749,
"smape": 0.48054883253120134
}
]
},
"forecast_dates": [
"2026-07-28",
"2026-08-01",
"2026-09-01",
"2026-10-01",
"2026-11-01",
"2026-12-01",
"2026-12-31"
],
"scenarios": [
{
"id": "base",
"label": "Base",
"kind": "base",
"probability": 0.58,
"assumptions": [
"Model-averaged historical dynamics continue within the benchmark definition."
],
"parameters": {},
"forecast_points": [
{
"date": "2026-07-28",
"median": 960.0,
"mean": 956.8173748832711,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
},
{
"date": "2026-08-01",
"median": 960.0,
"mean": 958.871185693314,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
},
{
"date": "2026-09-01",
"median": 960.0,
"mean": 956.4287204794122,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
},
{
"date": "2026-10-01",
"median": 960.0,
"mean": 960.0,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
},
{
"date": "2026-11-01",
"median": 960.0,
"mean": 960.0,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
},
{
"date": "2026-12-01",
"median": 960.0,
"mean": 960.0,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
},
{
"date": "2026-12-31",
"median": 960.0,
"mean": 960.0,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
}
],
"horizon_summary": {
"date": "2026-12-31",
"median": 960.0,
"mean": 960.0,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
},
"invalidation_conditions": [
"A benchmark version change breaks comparability."
]
},
{
"id": "accelerated",
"label": "Accelerated",
"kind": "accelerated",
"probability": 0.2,
"assumptions": [
"Recent acceleration persists."
],
"parameters": {
"annual_growth_shift": 0.08,
"annual_acceleration_shift": 0.05
},
"forecast_points": [
{
"date": "2026-07-28",
"median": 960.0,
"mean": 956.8173748832711,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
},
{
"date": "2026-08-01",
"median": 960.0,
"mean": 958.8786362302579,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
},
{
"date": "2026-09-01",
"median": 960.0,
"mean": 956.4765099179048,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
},
{
"date": "2026-10-01",
"median": 960.0,
"mean": 960.0,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
},
{
"date": "2026-11-01",
"median": 960.0,
"mean": 960.0,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
},
{
"date": "2026-12-01",
"median": 960.0,
"mean": 960.0,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
},
{
"date": "2026-12-31",
"median": 960.0,
"mean": 960.0,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
}
],
"horizon_summary": {
"date": "2026-12-31",
"median": 960.0,
"mean": 960.0,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
},
"invalidation_conditions": [
"Recent-window growth falls materially below the prior window."
]
},
{
"id": "downside",
"label": "Saturation / measurement stress",
"kind": "downside",
"probability": 0.17,
"assumptions": [
"Benchmark saturation or measurement limitations dominate."
],
"parameters": {
"annual_drag": 0.18,
"immediate_multiplier": 0.98,
"floor_multiplier": 0.6
},
"forecast_points": [
{
"date": "2026-07-28",
"median": 960.0,
"mean": 956.3509226696402,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 952.3295024118107,
"upper": 960.0
}
}
},
{
"date": "2026-08-01",
"median": 960.0,
"mean": 958.6854128935103,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
},
{
"date": "2026-09-01",
"median": 960.0,
"mean": 956.2071114252198,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
},
{
"date": "2026-10-01",
"median": 960.0,
"mean": 960.0,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
},
{
"date": "2026-11-01",
"median": 960.0,
"mean": 960.0,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
},
{
"date": "2026-12-01",
"median": 960.0,
"mean": 960.0,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
},
{
"date": "2026-12-31",
"median": 960.0,
"mean": 960.0,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
}
],
"horizon_summary": {
"date": "2026-12-31",
"median": 960.0,
"mean": 960.0,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
},
"invalidation_conditions": [
"Fresh harder tasks preserve comparable headroom."
]
},
{
"id": "discontinuous",
"label": "Discontinuous",
"kind": "discontinuous",
"probability": 0.05,
"assumptions": [
"A structural improvement loop materially changes the trajectory."
],
"parameters": {
"annual_transition_hazard": 0.15,
"jump_multiplier": 1.15,
"growth_rate_compounding": 0.25,
"initial_growth_bonus": 0.12
},
"forecast_points": [
{
"date": "2026-07-28",
"median": 960.0,
"mean": 956.8173748832711,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
},
{
"date": "2026-08-01",
"median": 960.0,
"mean": 958.871185693314,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
},
{
"date": "2026-09-01",
"median": 960.0,
"mean": 956.4287204794122,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
},
{
"date": "2026-10-01",
"median": 960.0,
"mean": 960.0,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
},
{
"date": "2026-11-01",
"median": 960.0,
"mean": 960.0,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
},
{
"date": "2026-12-01",
"median": 960.0,
"mean": 960.0,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
},
{
"date": "2026-12-31",
"median": 960.0,
"mean": 960.0,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
}
],
"horizon_summary": {
"date": "2026-12-31",
"median": 960.0,
"mean": 960.0,
"intervals": {
"p50": {
"level": 0.5,
"lower": 960.0,
"upper": 960.0
},
"p80": {
"level": 0.8,
"lower": 960.0,
"upper": 960.0
},
"p95": {
"level": 0.95,
"lower": 960.0,
"upper": 960.0
}
}
},
"invalidation_conditions": [
"No verified regime-change signal appears."
]
}
],
"milestones": [
{
"id": "suite-limit",
"label": "Published approximate 16-hour reliability boundary",
"threshold": 960,
"direction": "at_least",
"prerequisites": [
"Measurement remains within a valid benchmark range."
],
"scenario_results": {
"base": {
"probability_by_horizon": 1.0,
"median_crossing_date": "2026-07-28",
"p10_crossing_date": "2026-07-28",
"p90_crossing_date": "2026-07-28"
},
"accelerated": {
"probability_by_horizon": 1.0,
"median_crossing_date": "2026-07-28",
"p10_crossing_date": "2026-07-28",
"p90_crossing_date": "2026-07-28"
},
"downside": {
"probability_by_horizon": 1.0,
"median_crossing_date": "2026-07-28",
"p10_crossing_date": "2026-07-28",
"p90_crossing_date": "2026-07-28"
},
"discontinuous": {
"probability_by_horizon": 1.0,
"median_crossing_date": "2026-07-28",
"p10_crossing_date": "2026-07-28",
"p90_crossing_date": "2026-07-28"
}
}
}
],
"bottlenecks": [
{
"name": "Benchmark measurement range",
"severity": "critical",
"mechanism": "The published task suite becomes unreliable above approximately 16 hours.",
"release_condition": "A validated harder task suite extends the measurable range.",
"mitigation": "Treat 960 minutes as a measurement boundary, not a capability ceiling.",
"evidence_ids": [
"metr-time-horizon-1-1"
]
}
],
"triggers": [
{
"name": "New official METR release",
"direction": "event",
"threshold": "New version or measurement",
"forecast_effect": "Changes the evidence clock and possibly the measurement regime.",
"action": "Recalculate immediately with frozen upstream data.",
"evidence_ids": [
"metr-time-horizon-1-1"
]
}
],
"optimal_plan": {
"no_regret_actions": [
"Freeze source snapshots and record benchmark/configuration changes.",
"Use rolling-origin scores rather than in-sample fit alone."
],
"option_preserving_actions": [
"Maintain multiple model classes and trigger-based recalibration."
],
"next_experiment": [
"Add the complete upstream dataset and rerun the preregistered hindcast."
],
"delay_pending_evidence": [
"Do not translate benchmark movement directly into revenue or deployment."
],
"stop_expand_pivot": [
"Expand confidence only after independent replication and prospective calibration."
]
},
"confidence": {
"evidence_quality_score": 0.9,
"horizon_log_model_disagreement": 1.6940806574243936,
"base_horizon_p80_relative_width": 0.0,
"limitations": [
"Small, incomplete, hand-transcribed excerpt.",
"Benchmark horizon is not runtime, autonomy duration, or economy-wide automation.",
"The 960-minute cap represents a measurement boundary."
],
"assumptions": [
"The selected within-range observations are sufficiently comparable for an illustrative reduced-form fit."
]
},
"recalculation": {
"scheduled_date": "2026-08-27",
"early_triggers": [
"New official METR measurement",
"Benchmark methodology revision"
],
"required_evidence": [
"Complete official data freeze",
"Updated benchmark version notes",
"Independent reproduction where available"
]
},
"reproducibility": {
"input_sha256": "66d5512cf0a512703783ec08df4d22e1123b7570b1f64ef4cbac1d288ade86ea",
"random_seed": 20260728,
"bootstrap_samples_requested": 100,
"bootstrap_samples_successful": 100,
"models": [
"linear",
"exponential",
"accelerating",
"decaying_acceleration",
"logistic",
"change_point"
],
"code_version": "2.0.0"
},
"legal_notice": "Research and decision-support output only. No warranty, assurance, legal, investment, tax, medical, or regulatory advice is provided."
}