What does a useful improvement look like across cost, acceptance and latency?
For evaluators: compare strategies against an explicit micro-dataset and acceptance rules before making broader utility claims.
01
Read the workload
Ten synthetic jobs define baseline acceptance, cost and latency. Candidate values are derived using strategy multipliers; this is a model, not an independent real-world benchmark.
The runner applies rules, owner controls and strategy profiles and writes reports and dashboards. Check-mode avoids writing artifacts when supported by the selected command.
{"revision":"5b4cebb309a83a7a6749d8911d8bf96a1921e042","sources":[{"file":"demo/AGIJobs-Day-One-Utility-Benchmark/config/microset.yaml","content":"# Deterministic micro dataset of jobs (baseline metrics only). Candidate values\n# are derived via strategy multipliers to keep the dataset compact while still\n# supporting dozens of high-leverage simulations.\njobs:\n - id: job1\n baseline_acceptance: 5.0\n baseline_cost: 1.0\n baseline_latency: 0.10\n - id: job2\n baseline_acceptance: 15.0\n baseline_cost: 3.0\n baseline_latency: 0.20\n - id: job3\n baseline_acceptance: 20.0\n baseline_cost: 4.0\n baseline_latency: 0.30\n - id: job4\n baseline_acceptance: 10.0\n baseline_cost: 2.0\n baseline_latency: 0.40\n - id: job5\n baseline_acceptance: 10.0\n baseline_cost: 2.0\n baseline_latency: 0.50\n - id: job6\n baseline_acceptance: 10.0\n baseline_cost: 2.0\n baseline_latency: 0.60\n - id: job7\n baseline_acceptance: 10.0\n baseline_cost: 2.0\n baseline_latency: 0.70\n - id: job8\n baseline_acceptance: 10.0\n baseline_cost: 2.0\n baseline_latency: 0.80\n - id: job9\n baseline_acceptance: 5.0\n baseline_cost: 1.0\n baseline_latency: 0.90\n - id: job10\n baseline_acceptance: 5.0\n baseline_cost: 1.0\n baseline_latency: 1.00\n","format":"text","sha256":"4398c2cf121bddf680d936b5ff228e1200f4d2ff6f064f56d8298fbf446bc31b","bytes":1143,"download":"/AGIJobsv0/examples/4398c2cf121bddf6-microset.yaml","source":"https://github.com/MontrealAI/AGIJobsv0/blob/5b4cebb309a83a7a6749d8911d8bf96a1921e042/demo/AGIJobs-Day-One-Utility-Benchmark/config/microset.yaml"},{"file":"demo/AGIJobs-Day-One-Utility-Benchmark/config/strategies.yaml","content":"strategies:\n e2e:\n title: \"Day-One Utility Benchmark\"\n acceptance_multiplier: 1.09\n cost_multiplier: 1.03\n latency_multiplier: 0.96\n reliability_score: 0.97\n qualitative_uplift_bps: 180\n treasury_bonus_bps: 35\n description: >-\n The flagship launch configuration that proves a non-technical operator can\n wield AGI Jobs v0 (v2) to deploy a sovereign employment lattice from day\n one. The orchestration pipeline auto-optimizes end-to-end throughput while\n respecting strict latency guardrails.\n highlights:\n - Instant microset onboarding with verifiable audit log\n - Autonomous treasury balancing with programmable basis point guardrails\n - Guided launch playbook surfacing owner controls in natural language\n - Telemetry-grade exports for compliance, board review, and investors\n alphaevolve:\n title: \"AlphaEvolve Utility Surge\"\n acceptance_multiplier: 1.12\n cost_multiplier: 1.05\n latency_multiplier: 0.93\n reliability_score: 0.96\n qualitative_uplift_bps: 240\n treasury_bonus_bps: 45\n description: >-\n Accelerates the candidate experience with predictive matching heuristics\n and autonomous dispute resolution hooks, optimized for fast experimentation\n in alpha partnerships.\n highlights:\n - Predictive matching heuristics unlock immediate hiring speed\n - Autonomous dispute resolution hooks reduce operational drag\n - Realtime governance ledger exports for investor-grade reporting\n - Built-in capital efficiency telemetry for treasury oversight\n hgm:\n title: \"Huxley-Gödel Machine Day-One Governance\"\n acceptance_multiplier: 1.08\n cost_multiplier: 1.01\n latency_multiplier: 0.95\n reliability_score: 0.98\n qualitative_uplift_bps: 160\n treasury_bonus_bps: 28\n description: >-\n Hardened governance and monitoring configuration mirroring production\n expectations for regulated markets. Prioritizes deterministic guardrails\n and upgrade-safe owner operations.\n highlights:\n - Deterministic guardrail validations with double-entry audit trails\n - Upgrade-safe owner command deck with pause + resume workflows\n - Sovereign control plane for cross-module orchestration\n - Zero-trust telemetry channel feeding compliance observatories\n trm:\n title: \"Total Revenue Maximizer\"\n acceptance_multiplier: 1.15\n cost_multiplier: 1.07\n latency_multiplier: 0.99\n reliability_score: 0.95\n qualitative_uplift_bps: 320\n treasury_bonus_bps: 52\n description: >-\n Aggressive monetization profile for high-throughput enterprises eager to\n route entire talent networks through AGI Jobs. Validates that scale-ready\n revenue streams remain under explicit owner supervision.\n highlights:\n - Treasury autopilot with guardrailed surge pricing modules\n - Multi-market telemetry to prove business continuity readiness\n - Owner-governed liquidity valves for sustainable reinvestment\n - Performance envelopes for demand, supply, and arbitration rings\n omni:\n title: \"Omni-Concord Infinity Launch\"\n acceptance_multiplier: 1.18\n cost_multiplier: 1.06\n latency_multiplier: 0.92\n reliability_score: 0.99\n qualitative_uplift_bps: 410\n treasury_bonus_bps: 65\n description: >-\n Demonstrates the fully composable omnidomain orchestrator: governance,\n execution, attestation, and treasury fusion in one click. This is the\n operational portrait of an unstoppable labor intelligence platform.\n highlights:\n - Interleaved staking, validation, and arbitration autopipelines\n - Multi-chain attestation proofs with zero-knowledge readiness\n - Sovereign consensus overlays for global workforce mobility\n - Treasury surge buffer with proactive risk-off sequencing\n","format":"text","sha256":"886ec33f1ed3eb90610608ed78aef18a612c88c84373974cc023dfc5b957a071","bytes":3835,"download":"/AGIJobsv0/examples/886ec33f1ed3eb90-strategies.yaml","source":"https://github.com/MontrealAI/AGIJobsv0/blob/5b4cebb309a83a7a6749d8911d8bf96a1921e042/demo/AGIJobs-Day-One-Utility-Benchmark/config/strategies.yaml"},{"file":"demo/AGIJobs-Day-One-Utility-Benchmark/demo_runner.py","content":"\"\"\"Utility benchmark demo orchestrator for AGI Jobs v0 (v2).\n\nThe orchestrator is intentionally designed to be approachable for a\nnon-technical operator while still modelling the governance hooks and\ntelemetry collection that production deployments demand.\n\"\"\"\n\nfrom __future__ import annotations\n\nimport argparse\nimport datetime as dt\nimport json\nimport math\nimport re\nimport sys\nfrom dataclasses import dataclass\nfrom pathlib import Path\nfrom typing import Any, Dict, Iterable, List, Mapping, MutableMapping, Optional, Sequence, Tuple\n\ntry:\n import yaml # type: ignore\nexcept ImportError as exc: # pragma: no cover - guarded by deps target\n raise ImportError(\n \"PyYAML is required for the AGI Jobs day-one demo. Install dependencies with `make deps`.\"\n ) from exc\n\nplot_available = True\ntry: # pragma: no cover - runtime capability detection\n import matplotlib\n\n matplotlib.use(\"Agg\")\n import matplotlib.pyplot as plt\nexcept ImportError: # pragma: no cover\n plot_available = False\n\n\n@dataclass(frozen=True)\nclass JobRecord:\n \"\"\"Represents a deterministic micro job snapshot.\"\"\"\n\n job_id: str\n baseline_acceptance: float\n baseline_cost: float\n baseline_latency: float\n\n\n@dataclass(frozen=True)\nclass StrategyProfile:\n \"\"\"Configuration describing how to transform baseline telemetry.\"\"\"\n\n name: str\n title: str\n acceptance_multiplier: float\n cost_multiplier: float\n latency_multiplier: float\n reliability_score: float\n description: str\n highlights: Sequence[str]\n treasury_bonus_bps: int = 0\n # When positive this adds a utility boost that simulates better matching quality.\n qualitative_uplift_bps: int = 0\n\n\nclass StrategyNotFoundError(KeyError):\n \"\"\"Raised when a strategy is requested that is not configured.\"\"\"\n\n\nclass DemoPausedError(RuntimeError):\n \"\"\"Raised when the owner has paused the demo pipeline.\"\"\"\n\n\nclass DayOneUtilityOrchestrator:\n \"\"\"Central orchestrator for the day-one utility benchmark demo.\"\"\"\n\n OWNER_SCHEMA: Mapping[str, Any] = {\n \"owner_address\": str,\n \"treasury_address\": str,\n \"platform_fee_bps\": int,\n \"latency_threshold_override_bps\": (int, type(None)),\n \"utility_threshold_override_bps\": (int, type(None)),\n \"paused\": bool,\n \"narrative\": str,\n }\n\n def __init__(self, base_path: Optional[Path] = None, output_dir: Optional[Path] = None) -> None:\n self.base_path = base_path or Path(__file__).resolve().parent\n self.config_dir = self.base_path / \"config\"\n self.output_dir = output_dir or (self.base_path / \"out\")\n self._ensure_output_dir(self.output_dir)\n self._owner_config_path = self.config_dir / \"owner_controls.yaml\"\n self._owner_defaults_path = self.config_dir / \"owner_controls.defaults.yaml\"\n if not self._owner_defaults_path.exists():\n raise FileNotFoundError(\n \"Owner control defaults missing. Ensure owner_controls.defaults.yaml is present.\"\n )\n if not self._owner_config_path.exists():\n self._restore_owner_controls_from_defaults()\n self._validate_owner_controls(self.load_owner_controls())\n\n # ------------------------------------------------------------------\n # Configuration helpers\n # ------------------------------------------------------------------\n def _load_yaml(self, path: Path) -> Any:\n with path.open(\"r\", encoding=\"utf-8\") as handle:\n return yaml.safe_load(handle)\n\n def _save_yaml(self, path: Path, payload: Mapping[str, Any]) -> None:\n with path.open(\"w\", encoding=\"utf-8\") as handle:\n yaml.safe_dump(payload, handle, sort_keys=False)\n\n @staticmethod\n def _ensure_output_dir(path: Path) -> None:\n path.mkdir(parents=True, exist_ok=True)\n\n def load_jobs(self) -> List[JobRecord]:\n dataset_path = self.config_dir / \"microset.yaml\"\n dataset = self._load_yaml(dataset_path)\n\n if dataset is None:\n raise ValueError(f\"{dataset_path} is empty; define at least one job entry.\")\n\n jobs: Iterable[Mapping[str, Any]]\n if isinstance(dataset, Mapping):\n jobs = dataset.get(\"jobs\", []) # type: ignore[assignment]\n elif isinstance(dataset, Sequence) and not isinstance(dataset, (str, bytes)):\n jobs = dataset # type: ignore[assignment]\n else:\n raise TypeError(\"microset.yaml must contain a mapping or list of job definitions\")\n\n records: List[JobRecord] = []\n for entry in jobs:\n try:\n records.append(\n JobRecord(\n job_id=str(entry[\"id\"]),\n baseline_acceptance=float(entry[\"baseline_acceptance\"]),\n baseline_cost=float(entry[\"baseline_cost\"]),\n baseline_latency=float(entry[\"baseline_latency\"]),\n )\n )\n except (KeyError, TypeError, ValueError) as exc: # pragma: no cover - config guard\n raise ValueError(f\"Invalid job entry in {dataset_path}: {entry}\") from exc\n\n if not records:\n raise ValueError(f\"No jobs configured in {dataset_path}\")\n return records\n\n def load_rules(self) -> Mapping[str, Any]:\n payload = self._load_yaml(self.config_dir / \"rules.yaml\")\n if not isinstance(payload, Mapping):\n raise TypeError(\"rules.yaml must be a mapping\")\n return payload\n\n def load_strategies(self) -> Mapping[str, StrategyProfile]:\n payload = self._load_yaml(self.config_dir / \"strategies.yaml\")\n strategies_raw: Mapping[str, Any]\n if not isinstance(payload, Mapping):\n raise TypeError(\"strategies.yaml must contain a mapping of strategy definitions\")\n strategies_raw = payload.get(\"strategies\", payload) # type: ignore[assignment]\n profiles: Dict[str, StrategyProfile] = {}\n for key, value in strategies_raw.items():\n try:\n profile = StrategyProfile(\n name=key,\n title=str(value.get(\"title\", key.title())),\n acceptance_multiplier=float(value[\"acceptance_multiplier\"]),\n cost_multiplier=float(value[\"cost_multiplier\"]),\n latency_multiplier=float(value[\"latency_multiplier\"]),\n reliability_score=float(value.get(\"reliability_score\", 0.95)),\n description=str(value.get(\"description\", \"\")),\n highlights=tuple(value.get(\"highlights\", [])),\n treasury_bonus_bps=int(value.get(\"treasury_bonus_bps\", 0)),\n qualitative_uplift_bps=int(value.get(\"qualitative_uplift_bps\", 0)),\n )\n except (KeyError, TypeError, ValueError) as exc: # pragma: no cover - configuration guard\n raise ValueError(f\"Invalid strategy configuration for {key}\") from exc\n profiles[key.lower()] = profile\n self._add_strategy_aliases(profiles)\n if not profiles:\n raise ValueError(\"At least one strategy must be defined in strategies.yaml\")\n return profiles\n\n @staticmethod\n def _add_strategy_aliases(profiles: Dict[str, StrategyProfile]) -> None:\n \"\"\"Inject forgiving aliases for the flagship configurations.\"\"\"\n\n aliases = {\"core\": \"e2e\", \"default\": \"e2e\"}\n for alias, target in aliases.items():\n target_key = target.lower()\n if target_key in profiles and alias not in profiles:\n profiles[alias] = profiles[target_key]\n\n # ------------------------------------------------------------------\n # Owner controls management\n # ------------------------------------------------------------------\n def load_owner_controls(self) -> Dict[str, Any]:\n payload = self._load_yaml(self._owner_config_path)\n if not isinstance(payload, MutableMapping): # pragma: no cover - config guard\n raise TypeError(\"owner_controls.yaml must contain a mapping\")\n\n defaults = self._load_owner_defaults()\n snapshot: Dict[str, Any] = {}\n repaired: list[str] = []\n for key in self.OWNER_SCHEMA.keys():\n if key in payload:\n snapshot[key] = payload[key]\n elif key in defaults:\n snapshot[key] = defaults[key]\n repaired.append(key)\n else: # pragma: no cover - schema guard\n raise KeyError(f\"Owner controls missing required field: {key}\")\n\n # Heal the on-disk configuration when we fill in missing defaults so future\n # runs stay stable even if a manual edit dropped a field.\n self._validate_owner_controls(snapshot)\n if repaired:\n self.save_owner_controls(snapshot)\n return snapshot\n\n def save_owner_controls(self, snapshot: Mapping[str, Any]) -> None:\n payload = {key: snapshot[key] for key in self.OWNER_SCHEMA.keys()}\n self._save_yaml(self._owner_config_path, payload)\n\n def _load_owner_defaults(self) -> Mapping[str, Any]:\n defaults = self._load_yaml(self._owner_defaults_path)\n if not isinstance(defaults, Mapping):\n raise TypeError(\"owner_controls.defaults.yaml must contain a mapping\")\n return defaults\n\n def _restore_owner_controls_from_defaults(self) -> Dict[str, Any]:\n defaults = self._load_owner_defaults()\n snapshot = {key: defaults[key] for key in self.OWNER_SCHEMA.keys()}\n self._validate_owner_controls(snapshot)\n self.save_owner_controls(snapshot)\n return snapshot\n\n def _coerce_owner_value(self, key: str, value: str) -> Any:\n if key not in self.OWNER_SCHEMA:\n raise KeyError(f\"Unknown owner control: {key}\")\n expected = self.OWNER_SCHEMA[key]\n if expected is bool:\n normalized = value.strip().lower()\n if normalized in {\"1\", \"true\", \"yes\", \"y\"}:\n return True\n if normalized in {\"0\", \"false\", \"no\", \"n\"}:\n return False\n raise ValueError(f\"Value '{value}' is not a valid boolean for {key}\")\n if expected is int:\n return int(value)\n if expected is str:\n return value\n if isinstance(expected, tuple):\n # Currently only used for Optional[int]\n if value.strip().lower() in {\"none\", \"null\", \"\"}:\n return None\n return int(value)\n return value\n\n def update_owner_control(self, key: str, value: str) -> Dict[str, Any]:\n snapshot = self.load_owner_controls()\n coerced = self._coerce_owner_value(key, value)\n snapshot[key] = coerced\n self._validate_owner_controls(snapshot)\n self.save_owner_controls(snapshot)\n return snapshot\n\n def toggle_pause(self) -> Dict[str, Any]:\n snapshot = self.load_owner_controls()\n snapshot[\"paused\"] = not bool(snapshot[\"paused\"])\n self._validate_owner_controls(snapshot)\n self.save_owner_controls(snapshot)\n return snapshot\n\n def reset_owner_controls(self) -> Dict[str, Any]:\n return self._restore_owner_controls_from_defaults()\n\n def _validate_owner_controls(self, snapshot: Mapping[str, Any]) -> None:\n fee = int(snapshot[\"platform_fee_bps\"])\n if fee < 0 or fee > 2500:\n raise ValueError(\"platform_fee_bps must be between 0 and 2500 basis points\")\n latency_override = snapshot.get(\"latency_threshold_override_bps\")\n if latency_override is not None:\n latency_val = int(latency_override)\n if latency_val < -1000:\n raise ValueError(\"latency threshold override cannot reduce guardrails below -1000 bps\")\n utility_override = snapshot.get(\"utility_threshold_override_bps\")\n if utility_override is not None:\n utility_val = int(utility_override)\n if utility_val < -1000 or utility_val > 100_000:\n raise ValueError(\n \"utility threshold override must be between -1000 and 100000 basis points\"\n )\n narrative = str(snapshot.get(\"narrative\", \"\"))\n if len(narrative) > 1200:\n raise ValueError(\"narrative section is capped at 1200 characters\")\n for label in (\"owner_address\", \"treasury_address\"):\n address = str(snapshot.get(label, \"\"))\n if not re.fullmatch(r\"0x[a-fA-F0-9]{40}\", address):\n raise ValueError(f\"{label} must be an EVM address (0x-prefixed, 40 hex chars)\")\n\n # ------------------------------------------------------------------\n # Simulation\n # ------------------------------------------------------------------\n def _shannon_entropy(self, samples: Sequence[float]) -> float:\n total = sum(samples)\n if total <= 0:\n return 0.0\n entropy = 0.0\n for value in samples:\n if value <= 0:\n continue\n prob = value / total\n entropy -= prob * math.log(prob)\n return entropy\n\n def _compute_thermodynamics(\n self,\n *,\n baseline_utility: float,\n candidate_utility: float,\n total_candidate_cost: float,\n avg_candidate_latency: float,\n latency_delta: float,\n utility_uplift: float,\n candidate_latencies: Sequence[float],\n utility_threshold: float,\n latency_threshold: float,\n reliability_score: float,\n ) -> Mapping[str, float]:\n entropy = self._shannon_entropy(candidate_latencies)\n if len(candidate_latencies) > 1:\n max_entropy = math.log(len(candidate_latencies))\n entropy_ratio = entropy / max_entropy\n else:\n entropy_ratio = 0.0\n entropy_margin_sigma = max(0.0, (1.0 - entropy_ratio) * 3.0)\n temperature = max(avg_candidate_latency, 0.05)\n free_energy_margin = candidate_utility - baseline_utility\n gibbs_free_energy = candidate_utility - (temperature * entropy)\n hamiltonian = gibbs_free_energy - abs(latency_delta) * total_candidate_cost\n scale = max(1.0, abs(baseline_utility))\n hamiltonian_stability = 1.0 / (1.0 + math.exp(-hamiltonian / scale))\n utility_gap = max(0.0, utility_threshold - utility_uplift)\n latency_gap = max(0.0, latency_delta - latency_threshold)\n reliability_gap = max(0.0, 0.92 - reliability_score)\n game_theory_slack = max(0.0, min(1.0, 1.0 - (utility_gap + latency_gap + reliability_gap)))\n\n return {\n \"entropy\": entropy,\n \"entropy_ratio\": entropy_ratio,\n \"entropy_margin_sigma\": entropy_margin_sigma,\n \"temperature\": temperature,\n \"free_energy_margin\": free_energy_margin,\n \"gibbs_free_energy\": gibbs_free_energy,\n \"hamiltonian\": hamiltonian,\n \"hamiltonian_stability\": hamiltonian_stability,\n \"game_theory_slack\": game_theory_slack,\n }\n\n def simulate(self, strategy_name: str, *, write_artifacts: bool = True) -> Mapping[str, Any]:\n snapshot = self.load_owner_controls()\n if snapshot.get(\"paused\"):\n raise DemoPausedError(\"Demo is paused. Ask the owner to resume from the owner console.\")\n\n strategies = self.load_strategies()\n profile = strategies.get(strategy_name.lower())\n if profile is None:\n available = \", \".join(sorted(strategies))\n raise StrategyNotFoundError(f\"Unknown strategy '{strategy_name}'. Available: {available}\")\n\n jobs = self.load_jobs()\n rules = self.load_rules()\n utility_threshold = float(rules.get(\"utility_uplift_threshold\", 0.0))\n latency_threshold = float(rules.get(\"max_latency_delta\", math.inf))\n override_latency_bps = snapshot.get(\"latency_threshold_override_bps\")\n if override_latency_bps is not None:\n latency_threshold = override_latency_bps / 10_000.0\n override_utility_bps = snapshot.get(\"utility_threshold_override_bps\")\n if override_utility_bps is not None:\n utility_threshold = override_utility_bps / 10_000.0\n\n total_baseline_gmv = 0.0\n total_candidate_gmv = 0.0\n total_baseline_cost = 0.0\n total_candidate_cost = 0.0\n total_baseline_latency = 0.0\n total_candidate_latency = 0.0\n candidate_latencies: List[float] = []\n\n acceptance_multiplier = profile.acceptance_multiplier\n cost_multiplier = profile.cost_multiplier\n latency_multiplier = profile.latency_multiplier\n qualitative_uplift = profile.qualitative_uplift_bps / 10_000.0\n\n for job in jobs:\n total_baseline_gmv += job.baseline_acceptance\n total_baseline_cost += job.baseline_cost\n total_baseline_latency += job.baseline_latency\n\n candidate_acceptance = job.baseline_acceptance * acceptance_multiplier\n candidate_cost = job.baseline_cost * cost_multiplier\n candidate_latency = job.baseline_latency * latency_multiplier\n\n total_candidate_gmv += candidate_acceptance * (1.0 + qualitative_uplift)\n total_candidate_cost += candidate_cost\n total_candidate_latency += candidate_latency\n candidate_latencies.append(candidate_latency)\n\n platform_fee = total_candidate_gmv * snapshot[\"platform_fee_bps\"] / 10_000.0\n treasury_bonus = total_candidate_gmv * profile.treasury_bonus_bps / 10_000.0\n total_candidate_cost += platform_fee\n\n num_jobs = len(jobs)\n avg_baseline_latency = total_baseline_latency / num_jobs\n avg_candidate_latency = total_candidate_latency / num_jobs\n\n baseline_utility = total_baseline_gmv - total_baseline_cost\n candidate_utility = total_candidate_gmv - total_candidate_cost + treasury_bonus\n\n utility_uplift = self._safe_relative_change(candidate_utility, baseline_utility)\n latency_delta = self._safe_relative_change(avg_candidate_latency, avg_baseline_latency)\n\n latency_p95 = self._percentile(candidate_latencies, 0.95)\n\n owner_snapshot = {\n **snapshot,\n \"platform_fee_bps\": int(snapshot[\"platform_fee_bps\"]),\n \"latency_threshold_active\": latency_threshold,\n \"utility_threshold_active\": utility_threshold,\n \"treasury_bonus_bps\": profile.treasury_bonus_bps,\n \"treasury_bonus_value\": treasury_bonus,\n }\n\n guardrail_status = {\n \"utility_uplift\": utility_uplift >= utility_threshold,\n \"latency_delta\": latency_delta <= latency_threshold,\n \"reliability_score\": profile.reliability_score >= 0.92,\n }\n\n metrics_block = {\n \"baseline\": {\n \"total_gmv\": total_baseline_gmv,\n \"total_cost\": total_baseline_cost,\n \"utility\": baseline_utility,\n \"avg_latency\": avg_baseline_latency,\n },\n \"candidate\": {\n \"total_gmv\": total_candidate_gmv,\n \"total_cost\": total_candidate_cost,\n \"utility\": candidate_utility,\n \"avg_latency\": avg_candidate_latency,\n \"platform_fee\": platform_fee,\n \"treasury_bonus\": treasury_bonus,\n },\n \"utility_uplift\": utility_uplift,\n \"latency_delta\": latency_delta,\n \"latency_p95\": latency_p95,\n \"owner_treasury\": platform_fee + treasury_bonus,\n }\n\n thermodynamics = self._compute_thermodynamics(\n baseline_utility=baseline_utility,\n candidate_utility=candidate_utility,\n total_candidate_cost=total_candidate_cost,\n avg_candidate_latency=avg_candidate_latency,\n latency_delta=latency_delta,\n utility_uplift=utility_uplift,\n candidate_latencies=candidate_latencies,\n utility_threshold=utility_threshold,\n latency_threshold=latency_threshold,\n reliability_score=profile.reliability_score,\n )\n action_path = self._build_action_path(\n metrics_block=metrics_block,\n thermodynamics=thermodynamics,\n guardrail_status=guardrail_status,\n utility_threshold=utility_threshold,\n latency_threshold=latency_threshold,\n reliability_score=profile.reliability_score,\n )\n\n report = {\n \"generated_at\": dt.datetime.now(dt.timezone.utc).isoformat(),\n \"strategy\": profile.name,\n \"strategy_profile\": {\n \"title\": profile.title,\n \"description\": profile.description,\n \"highlights\": list(profile.highlights),\n \"reliability_score\": profile.reliability_score,\n },\n \"metrics\": metrics_block,\n \"thermodynamics\": thermodynamics,\n \"rules\": {\n \"utility_uplift_threshold\": utility_threshold,\n \"max_latency_delta\": latency_threshold,\n },\n \"guardrail_pass\": guardrail_status,\n \"owner_controls\": owner_snapshot,\n \"mermaid\": self._build_mermaid_summaries(profile, guardrail_status),\n \"action_path\": action_path,\n }\n\n chart_path = None\n html_path = None\n if write_artifacts:\n self._ensure_output_dir(self.output_dir)\n if plot_available:\n chart_path = self._render_chart(profile, metrics_block)\n html_path = self._render_dashboard(report, chart_path)\n\n self._write_json(self.output_dir / f\"report_{profile.name}.json\", report)\n self._write_json(self.output_dir / \"owner_controls_snapshot.json\", owner_snapshot)\n\n report[\"outputs\"] = {\n \"chart\": str(chart_path) if chart_path else None,\n \"dashboard\": str(html_path) if html_path else None,\n }\n return report\n\n def _write_json(self, path: Path, payload: Mapping[str, Any]) -> None:\n path.parent.mkdir(parents=True, exist_ok=True)\n with path.open(\"w\", encoding=\"utf-8\") as handle:\n json.dump(payload, handle, indent=2, sort_keys=True)\n\n @staticmethod\n def _clamp01(value: float) -> float:\n return max(0.0, min(1.0, value))\n\n @staticmethod\n def _safe_relative_change(candidate: float, baseline: float) -> float:\n \"\"\"Return a finite relative change even when baseline is zero.\"\"\"\n if math.isclose(baseline, 0.0, abs_tol=1e-12):\n if math.isclose(candidate, 0.0, abs_tol=1e-12):\n return 0.0\n return math.copysign(1.0, candidate)\n return (candidate - baseline) / abs(baseline)\n\n @staticmethod\n def _percentile(values: Sequence[float], quantile: float) -> float:\n \"\"\"Return a percentile using linear interpolation for small samples.\"\"\"\n if not values:\n return 0.0\n if quantile <= 0.0:\n return min(values)\n if quantile >= 1.0:\n return max(values)\n ordered = sorted(values)\n rank = quantile * (len(ordered) - 1)\n lower = math.floor(rank)\n upper = math.ceil(rank)\n if lower == upper:\n return ordered[int(rank)]\n weight = rank - lower\n return (1 - weight) * ordered[int(lower)] + weight * ordered[int(upper)]\n\n def _build_action_path(\n self,\n *,\n metrics_block: Mapping[str, Any],\n thermodynamics: Mapping[str, float],\n guardrail_status: Mapping[str, bool],\n utility_threshold: float,\n latency_threshold: float,\n reliability_score: float,\n ) -> List[Mapping[str, Any]]:\n actions: List[Dict[str, Any]] = []\n\n utility_gap = max(0.0, utility_threshold - metrics_block[\"utility_uplift\"])\n latency_gap = max(0.0, metrics_block[\"latency_delta\"] - latency_threshold)\n reliability_gap = max(0.0, 0.92 - reliability_score)\n\n if not guardrail_status[\"utility_uplift\"]:\n priority = self._clamp01(utility_gap / max(0.05, abs(utility_threshold)))\n actions.append(\n {\n \"title\": \"Lift day-one utility above guardrail\",\n \"rationale\": (\n f\"Utility uplift is {metrics_block['utility_uplift']*100:.2f}% versus \"\n f\"{utility_threshold*100:.2f}% target. Adjust matching multipliers or treasury \"\n \"bonuses to unlock the Gibbs free energy headroom.\"\n ),\n \"priority\": priority,\n }\n )\n\n if not guardrail_status[\"latency_delta\"]:\n priority = self._clamp01(latency_gap / max(0.02, abs(latency_threshold)))\n actions.append(\n {\n \"title\": \"Reduce latency delta to stabilize the Hamiltonian\",\n \"rationale\": (\n f\"Latency delta is {metrics_block['latency_delta']*100:.2f}% vs \"\n f\"{latency_threshold*100:.2f}% threshold. Rebalance regional routing or \"\n \"allocate more capacity to constrained lanes.\"\n ),\n \"priority\": priority,\n }\n )\n\n if not guardrail_status[\"reliability_score\"]:\n priority = self._clamp01(reliability_gap / 0.92)\n actions.append(\n {\n \"title\": \"Restore reliability above 92% baseline\",\n \"rationale\": (\n f\"Reliability score is {reliability_score*100:.1f}%. Align validator cohorts \"\n \"and enforce redundancy to avoid entropy spikes.\"\n ),\n \"priority\": priority,\n }\n )\n\n if thermodynamics[\"hamiltonian_stability\"] < 0.6:\n priority = self._clamp01(1.0 - thermodynamics[\"hamiltonian_stability\"])\n actions.append(\n {\n \"title\": \"Stabilize thermodynamic state variables\",\n \"rationale\": (\n f\"Hamiltonian stability is {thermodynamics['hamiltonian_stability']*100:.1f}%. \"\n \"Increase free energy buffers or tighten latency variance.\"\n ),\n \"priority\": priority,\n }\n )\n\n if thermodynamics[\"game_theory_slack\"] < 0.7:\n priority = self._clamp01(0.7 - thermodynamics[\"game_theory_slack\"])\n actions.append(\n {\n \"title\": \"Expand coalition incentives\",\n \"rationale\": (\n f\"Game-theory slack is {thermodynamics['game_theory_slack']*100:.1f}%. \"\n \"Align treasury bonuses and shard commitments to keep cooperative equilibria.\"\n ),\n \"priority\": priority,\n }\n )\n\n if thermodynamics[\"entropy_margin_sigma\"] < 1.0:\n priority = self._clamp01(1.0 - thermodynamics[\"entropy_margin_sigma\"])\n actions.append(\n {\n \"title\": \"Increase entropy buffers for operational safety\",\n \"rationale\": (\n f\"Entropy margin is {thermodynamics['entropy_margin_sigma']:.2f}σ. \"\n \"Increase diversification or reduce concentration in the job intake.\"\n ),\n \"priority\": priority,\n }\n )\n\n if not actions:\n actions.append(\n {\n \"title\": \"Maintain equilibrium and publish the mission briefing\",\n \"rationale\": (\n \"All guardrails are green; lock in the current policy, broadcast the action \"\n \"path to operators, and keep monitoring free energy drift.\"\n ),\n \"priority\": 0.2,\n }\n )\n\n actions_sorted = sorted(actions, key=lambda entry: entry[\"priority\"], reverse=True)\n for index, action in enumerate(actions_sorted, start=1):\n action[\"sequence\"] = index\n return actions_sorted\n\n # ------------------------------------------------------------------\n # Scoreboard orchestration\n # ------------------------------------------------------------------\n def scoreboard(\n self, strategies: Optional[Sequence[str]] = None, *, write_artifacts: bool = True\n ) -> Mapping[str, Any]:\n available = self.load_strategies()\n if strategies is None:\n requested = list(available.keys())\n else:\n requested = []\n for item in strategies:\n key = item.lower()\n if key not in available:\n raise StrategyNotFoundError(item)\n if key not in requested:\n requested.append(key)\n\n if not requested:\n raise ValueError(\"At least one strategy must be supplied to generate a scoreboard\")\n\n summaries: Dict[str, Mapping[str, Any]] = {}\n guardrail_failures: List[Mapping[str, Any]] = []\n owner_snapshot: Optional[Mapping[str, Any]] = None\n\n for key in requested:\n report = self.simulate(key, write_artifacts=write_artifacts)\n metrics = report[\"metrics\"]\n profile = report[\"strategy_profile\"]\n guardrails = report[\"guardrail_pass\"]\n failed = [name for name, passed in guardrails.items() if not passed]\n if failed:\n guardrail_failures.append({\n \"strategy\": key,\n \"title\": profile[\"title\"],\n \"failed\": failed,\n })\n summaries[key] = {\n \"title\": profile[\"title\"],\n \"utility_uplift\": float(metrics[\"utility_uplift\"]),\n \"latency_delta\": float(metrics[\"latency_delta\"]),\n \"latency_p95\": float(metrics.get(\"latency_p95\", 0.0)),\n \"owner_treasury\": float(metrics[\"owner_treasury\"]),\n \"reliability_score\": float(profile[\"reliability_score\"]),\n \"report_path\": str(self.output_dir / f\"report_{key}.json\") if write_artifacts else None,\n \"dashboard_path\": report[\"outputs\"][\"dashboard\"],\n \"snapshot_path\": report[\"outputs\"].get(\"chart\"),\n \"guardrail_pass\": guardrails,\n }\n owner_snapshot = report[\"owner_controls\"]\n\n utility_leader = max(summaries.items(), key=lambda item: item[1][\"utility_uplift\"])\n treasury_leader = max(summaries.items(), key=lambda item: item[1][\"owner_treasury\"])\n reliability_leader = max(summaries.items(), key=lambda item: item[1][\"reliability_score\"])\n latency_leader = min(summaries.items(), key=lambda item: item[1][\"latency_delta\"])\n latency_p95_leader = min(summaries.items(), key=lambda item: item[1][\"latency_p95\"])\n\n aggregates = {\n \"total_owner_treasury\": sum(item[\"owner_treasury\"] for item in summaries.values()),\n \"average_utility_uplift\": sum(item[\"utility_uplift\"] for item in summaries.values()) / len(summaries),\n \"average_latency_delta\": sum(item[\"latency_delta\"] for item in summaries.values()) / len(summaries),\n \"average_latency_p95\": sum(item[\"latency_p95\"] for item in summaries.values()) / len(summaries),\n }\n\n def _leader_payload(entry: Tuple[str, Mapping[str, Any]]) -> Mapping[str, Any]:\n key, payload = entry\n return {\n \"strategy\": key,\n \"title\": payload[\"title\"],\n \"value\": payload,\n }\n\n leaders = {\n \"utility_uplift\": _leader_payload(utility_leader),\n \"owner_treasury\": _leader_payload(treasury_leader),\n \"reliability\": _leader_payload(reliability_leader),\n \"latency_delta\": _leader_payload(latency_leader),\n \"latency_p95\": _leader_payload(latency_p95_leader),\n }\n\n if owner_snapshot is None:\n owner_snapshot = self.load_owner_controls()\n\n mermaid_blocks = self._build_scoreboard_mermaid(summaries, leaders)\n\n scoreboard_payload: Dict[str, Any] = {\n \"type\": \"scoreboard\",\n \"generated_at\": dt.datetime.now(dt.timezone.utc).isoformat(),\n \"strategies\": summaries,\n \"leaders\": leaders,\n \"aggregates\": aggregates,\n \"guardrail_failures\": guardrail_failures,\n \"owner_controls\": owner_snapshot,\n \"mermaid\": mermaid_blocks,\n }\n\n scoreboard_payload[\"metrics\"] = {\n \"utility_uplift\": leaders[\"utility_uplift\"][\"value\"][\"utility_uplift\"],\n \"latency_delta\": leaders[\"latency_delta\"][\"value\"][\"latency_delta\"],\n \"owner_treasury\": aggregates[\"total_owner_treasury\"],\n \"average_utility_uplift\": aggregates[\"average_utility_uplift\"],\n \"average_latency_delta\": aggregates[\"average_latency_delta\"],\n \"average_latency_p95\": aggregates[\"average_latency_p95\"],\n \"best_latency_p95\": leaders[\"latency_p95\"][\"value\"][\"latency_p95\"],\n }\n\n html_path = None\n if write_artifacts:\n html_path = self._render_scoreboard_html(scoreboard_payload)\n self._write_json(self.output_dir / \"scoreboard.json\", scoreboard_payload)\n scoreboard_payload[\"outputs\"] = {\"dashboard\": str(html_path) if html_path else None}\n return scoreboard_payload\n\n # ------------------------------------------------------------------\n # Visualization helpers\n # ------------------------------------------------------------------\n def _render_chart(self, profile: StrategyProfile, metrics: Mapping[str, Any]) -> Path:\n baseline = metrics[\"baseline\"]\n candidate = metrics[\"candidate\"]\n categories = [\"GMV\", \"Cost\", \"Utility\"]\n baseline_vals = [baseline[\"total_gmv\"], baseline[\"total_cost\"], baseline[\"utility\"]]\n candidate_vals = [candidate[\"total_gmv\"], candidate[\"total_cost\"], candidate[\"utility\"]]\n\n x_positions = range(len(categories))\n width = 0.36\n fig, ax = plt.subplots(figsize=(8, 4.8))\n ax.bar([x - width / 2 for x in x_positions], baseline_vals, width, label=\"Baseline\", color=\"#0F172A\")\n ax.bar([x + width / 2 for x in x_positions], candidate_vals, width, label=\"Candidate\", color=\"#38BDF8\")\n ax.set_xticks(list(x_positions))\n ax.set_xticklabels(categories, fontsize=11)\n ax.set_ylabel(\"Value\", fontsize=11)\n ax.set_title(f\"Baseline vs Candidate Metrics — {profile.title}\", fontsize=13)\n ax.legend(loc=\"upper left\")\n for idx, value in enumerate(baseline_vals):\n ax.text(idx - width / 2, value + max(baseline_vals + candidate_vals) * 0.02, f\"{value:.2f}\", ha=\"center\")\n for idx, value in enumerate(candidate_vals):\n ax.text(idx + width / 2, value + max(baseline_vals + candidate_vals) * 0.02, f\"{value:.2f}\", ha=\"center\")\n fig.tight_layout()\n chart_path = self.output_dir / f\"snapshot_{profile.name}.png\"\n fig.savefig(chart_path)\n plt.close(fig)\n return chart_path\n\n def _build_mermaid_summaries(\n self, profile: StrategyProfile, guardrail_status: Mapping[str, bool]\n ) -> Mapping[str, str]:\n guardrail_state = {\n key: \"Pass\" if value else \"Investigate\" for key, value in guardrail_status.items()\n }\n systems_diagram = f\"\"\"\n flowchart LR\n user((Operator Command Deck)) -->|orchestrates| orchestrator{{AGI Jobs Day-One Orchestrator}}\n orchestrator -->|pull microset| dataLake[(Curated Microset)]\n orchestrator -->|apply {profile.title}| strategyEngine[/Strategy Engine/]\n strategyEngine --> telemetry[(Telemetry Ledger)]\n telemetry -->|publish uplift| utility{{Utility Monitor}}\n utility -->|enforce guardrails| guardrails[(Sentinel Rules)]\n guardrails -->|status| dashboard{{Grand Demo Dashboard}}\n orchestrator -->|owner controls| ownerDeck[(Owner Controls)]\n \"\"\"\n\n guardrail_diagram = f\"\"\"\n graph TD\n A[Utility Uplift ≥ Threshold] --> B[{guardrail_state['utility_uplift']}]\n C[Latency Delta ≤ Guardrail] --> D[{guardrail_state['latency_delta']}]\n E[Reliability Score ≥ 0.92] --> F[{guardrail_state['reliability_score']}]\n B --> G{{Launch Verdict}}\n D --> G\n F --> G\n \"\"\"\n\n owner_flow = \"\"\"\n sequenceDiagram\n participant Owner as Contract Owner\n participant Console as Owner Console\n participant Orchestrator as Orchestrator\n participant Dashboard as Hyperdashboard\n Owner->>Console: Update control values\n Console->>Orchestrator: Write owner_controls.yaml\n Orchestrator->>Dashboard: Publish refreshed telemetry\n Dashboard-->>Owner: Render grandiose uplift narrative\n \"\"\"\n\n return {\n \"systems\": systems_diagram.strip(),\n \"guardrails\": guardrail_diagram.strip(),\n \"owner\": owner_flow.strip(),\n }\n\n def _build_scoreboard_mermaid(\n self, summaries: Mapping[str, Mapping[str, Any]], leaders: Mapping[str, Mapping[str, Any]]\n ) -> Mapping[str, str]:\n pie_lines = []\n for key, payload in summaries.items():\n pie_lines.append(f' \"{payload[\"title\"]}\" : {payload[\"owner_treasury\"]:.6f}')\n pie_chart = \"\\n\".join([\"pie showData\", *pie_lines])\n\n leader_flow = [\n \"flowchart TD\",\n \" A[Day-One Scoreboard] --> B[Utility Leader]\",\n f\" B -->|{leaders['utility_uplift']['title']}| C{{Utility}}\",\n \" A --> D[Treasury Leader]\",\n f\" D -->|{leaders['owner_treasury']['title']}| E{{Owner Treasury}}\",\n \" A --> F[Reliability Leader]\",\n f\" F -->|{leaders['reliability']['title']}| G{{Reliability}}\",\n \" A --> H[Latency Champion]\",\n f\" H -->|{leaders['latency_delta']['title']}| I{{Latency}}\",\n \" A --> J[P95 Sentinel]\",\n f\" J -->|{leaders['latency_p95']['title']}| K{{Latency P95}}\",\n ]\n\n guardrail_overview = [\"graph LR\"]\n for key, payload in summaries.items():\n guardrail = payload[\"guardrail_pass\"]\n status = \"Stable\" if all(guardrail.values()) else \"Investigate\"\n guardrail_overview.append(\n f\" {key.replace('-', '_')}[{payload['title']}] --> {status}\"\n )\n\n return {\n \"treasury\": pie_chart.strip(),\n \"leaders\": \"\\n\".join(leader_flow).strip(),\n \"guardrails\": \"\\n\".join(guardrail_overview).strip(),\n }\n\n def _render_dashboard(self, report: Mapping[str, Any], chart_path: Optional[Path]) -> Path:\n profile = report[\"strategy_profile\"]\n metrics = report[\"metrics\"]\n thermodynamics = report[\"thermodynamics\"]\n owner_controls = report[\"owner_controls\"]\n guardrail_pass = report[\"guardrail_pass\"]\n mermaid_blocks = report[\"mermaid\"]\n highlights = \"\".join(f\"<li>{item}</li>\" for item in profile[\"highlights\"])\n guardrail_badges = []\n for key, value in guardrail_pass.items():\n label = key.replace(\"_\", \" \").title()\n badge_class = \"pass\" if value else \"fail\"\n guardrail_badges.append(f'<span class=\"badge {badge_class}\">{label}</span>')\n guardrail_markup = \"\".join(guardrail_badges)\n utility_override_value = owner_controls.get(\"utility_threshold_override_bps\")\n if utility_override_value is None:\n utility_override_display = \"—\"\n else:\n utility_override_display = f\"{int(utility_override_value)} bps\"\n latency_override_value = owner_controls.get(\"latency_threshold_override_bps\")\n if latency_override_value is None:\n latency_override_display = \"—\"\n else:\n latency_override_display = f\"{int(latency_override_value)} bps\"\n chart_markup = (\n f'<img src=\"{Path(chart_path).name}\" alt=\"Strategy snapshot chart\" class=\"snapshot\" />'\n if chart_path\n else \"<p class=\\\"snapshot\\\">Matplotlib is unavailable in this environment.</p>\"\n )\n html = f\"\"\"\n <!DOCTYPE html>\n <html lang=\"en\">\n <head>\n <meta charset=\"utf-8\" />\n <title>{profile['title']} — Day-One Utility Command Deck</title>\n <meta name=\"viewport\" content=\"width=device-width, initial-scale=1\" />\n <link rel=\"preconnect\" href=\"https://fonts.googleapis.com\" />\n <link rel=\"preconnect\" href=\"https://fonts.gstatic.com\" crossorigin />\n <link href=\"https://fonts.googleapis.com/css2?family=Space+Grotesk:wght@400;600;700&display=swap\" rel=\"stylesheet\">\n <style>\n :root {{\n color-scheme: dark;\n --bg: #020617;\n --card: rgba(15, 23, 42, 0.8);\n --accent: #38bdf8;\n --accent-2: #f8fafc;\n --fail: #f87171;\n --pass: #34d399;\n }}\n body {{\n font-family: 'Space Grotesk', sans-serif;\n margin: 0;\n background: radial-gradient(circle at top, rgba(56,189,248,0.12), transparent 45%), var(--bg);\n color: var(--accent-2);\n min-height: 100vh;\n }}\n header {{\n padding: 3rem 5vw;\n text-align: center;\n }}\n header h1 {{\n font-size: clamp(2.8rem, 5vw, 4rem);\n margin-bottom: 0.5rem;\n }}\n header p {{\n max-width: 70ch;\n margin: 0 auto;\n line-height: 1.5;\n }}\n main {{\n display: grid;\n gap: 1.5rem;\n padding: 0 5vw 4rem;\n }}\n .card {{\n background: var(--card);\n border-radius: 18px;\n padding: 1.8rem;\n box-shadow: 0 40px 120px rgba(56,189,248,0.08);\n backdrop-filter: blur(12px);\n }}\n .grid-2 {{\n display: grid;\n grid-template-columns: repeat(auto-fit, minmax(280px, 1fr));\n gap: 1.2rem;\n }}\n h2 {{\n margin-top: 0;\n font-size: 1.6rem;\n }}\n .metrics-grid {{\n display: grid;\n grid-template-columns: repeat(auto-fit, minmax(180px, 1fr));\n gap: 1rem;\n }}\n .metric {{\n background: rgba(148, 163, 184, 0.12);\n border-radius: 14px;\n padding: 1rem;\n text-align: center;\n }}\n .metric h3 {{\n margin: 0;\n font-size: 0.95rem;\n text-transform: uppercase;\n letter-spacing: 0.08em;\n }}\n .metric p {{\n margin: 0.35rem 0 0;\n font-size: 1.5rem;\n font-weight: 600;\n }}\n .badge {{\n display: inline-flex;\n align-items: center;\n padding: 0.4rem 0.8rem;\n border-radius: 999px;\n font-size: 0.75rem;\n letter-spacing: 0.08em;\n text-transform: uppercase;\n margin-right: 0.5rem;\n }}\n .badge.pass {{ background: rgba(52, 211, 153, 0.18); color: var(--pass); }}\n .badge.fail {{ background: rgba(248, 113, 113, 0.18); color: var(--fail); }}\n .snapshot {{\n display: block;\n max-width: min(720px, 95%);\n margin: 0 auto;\n border-radius: 18px;\n border: 1px solid rgba(148, 163, 184, 0.2);\n box-shadow: 0 25px 80px rgba(15,23,42,0.4);\n }}\n ul {{\n margin: 0;\n padding-left: 1.1rem;\n line-height: 1.6;\n }}\n .mermaid {{\n margin-top: 1.5rem;\n background: rgba(15,23,42,0.6);\n border-radius: 16px;\n padding: 1rem;\n }}\n footer {{\n text-align: center;\n padding: 2rem 0;\n color: rgba(226,232,240,0.6);\n }}\n code {{\n background: rgba(148, 163, 184, 0.22);\n padding: 0.2rem 0.5rem;\n border-radius: 8px;\n font-size: 0.85rem;\n }}\n </style>\n </head>\n <body>\n <header>\n <h1>{profile['title']}</h1>\n <p>{profile['description']}</p>\n <div>{guardrail_markup}</div>\n </header>\n <main>\n <section class=\"card\">\n <h2>Launch Metrics</h2>\n <div class=\"metrics-grid\">\n <div class=\"metric\"><h3>Utility Uplift</h3><p>{metrics['utility_uplift']*100:.2f}%</p></div>\n <div class=\"metric\"><h3>Latency Delta</h3><p>{metrics['latency_delta']*100:.2f}%</p></div>\n <div class=\"metric\"><h3>Latency P95</h3><p>{metrics['latency_p95']:.3f}s</p></div>\n <div class=\"metric\"><h3>Reliability Score</h3><p>{profile['reliability_score']*100:.1f}</p></div>\n <div class=\"metric\"><h3>Owner Treasury</h3><p>{metrics['owner_treasury']:.2f}</p></div>\n </div>\n </section>\n <section class=\"card\">\n <h2>Strategy Highlights</h2>\n <div class=\"grid-2\">\n <div>\n <h3>What unlocks day-one value</h3>\n <ul>{highlights}</ul>\n </div>\n <div>\n <h3>Owner Controls Snapshot</h3>\n <p><strong>Owner:</strong> {owner_controls['owner_address']}</p>\n <p><strong>Treasury:</strong> {owner_controls['treasury_address']}</p>\n <p><strong>Platform Fee:</strong> {owner_controls['platform_fee_bps']} bps</p>\n <p><strong>Utility Guardrail:</strong> {owner_controls['utility_threshold_active']:.4f}</p>\n <p><strong>Utility Override:</strong> {utility_override_display}</p>\n <p><strong>Latency Guardrail:</strong> {owner_controls['latency_threshold_active']:.4f}</p>\n <p><strong>Latency Override:</strong> {latency_override_display}</p>\n <p><strong>Narrative:</strong> {owner_controls['narrative']}</p>\n </div>\n </div>\n </section>\n <section class=\"card\">\n <h2>Thermodynamic Guardrails</h2>\n <div class=\"metrics-grid\">\n <div class=\"metric\"><h3>Free Energy Margin</h3><p>{thermodynamics['free_energy_margin']:.2f}</p></div>\n <div class=\"metric\"><h3>Gibbs Free Energy</h3><p>{thermodynamics['gibbs_free_energy']:.2f}</p></div>\n <div class=\"metric\"><h3>Hamiltonian Stability</h3><p>{thermodynamics['hamiltonian_stability']*100:.1f}%</p></div>\n <div class=\"metric\"><h3>Entropy Margin</h3><p>{thermodynamics['entropy_margin_sigma']:.2f}σ</p></div>\n <div class=\"metric\"><h3>Game-Theory Slack</h3><p>{thermodynamics['game_theory_slack']*100:.1f}%</p></div>\n <div class=\"metric\"><h3>Temperature</h3><p>{thermodynamics['temperature']:.2f}</p></div>\n </div>\n </section>\n <section class=\"card\">\n <h2>Snapshot</h2>\n {chart_markup}\n </section>\n <section class=\"card\">\n <h2>Systems Blueprint</h2>\n <div class=\"mermaid\">{mermaid_blocks['systems']}</div>\n <div class=\"mermaid\">{mermaid_blocks['guardrails']}</div>\n <div class=\"mermaid\">{mermaid_blocks['owner']}</div>\n </section>\n </main>\n <footer>\n Generated at {report['generated_at']} · Powered by AGI Jobs v0 (v2)\n </footer>\n <script type=\"module\">\n import mermaid from 'https://cdn.jsdelivr.net/npm/mermaid@10/dist/mermaid.esm.min.mjs';\n mermaid.initialize({{ startOnLoad: true, theme: 'dark' }});\n </script>\n </body>\n </html>\n \"\"\"\n html_path = self.output_dir / f\"dashboard_{report['strategy']}.html\"\n with html_path.open(\"w\", encoding=\"utf-8\") as handle:\n handle.write(html)\n return html_path\n\n def _render_scoreboard_html(self, scoreboard: Mapping[str, Any]) -> Path:\n strategies = scoreboard[\"strategies\"]\n aggregates = scoreboard[\"aggregates\"]\n guardrail_failures: Sequence[Mapping[str, Any]] = scoreboard.get(\"guardrail_failures\", [])\n mermaid_blocks = scoreboard.get(\"mermaid\", {})\n leaders = scoreboard.get(\"leaders\", {})\n\n def _format_pct(value: float) -> str:\n return f\"{value * 100:.2f}%\"\n\n rows = []\n for key, payload in sorted(\n strategies.items(), key=lambda item: item[1][\"utility_uplift\"], reverse=True\n ):\n guardrail = payload[\"guardrail_pass\"]\n guardrail_badge = \"pass\" if all(guardrail.values()) else \"fail\"\n rows.append(\n \"\"\"\n <tr>\n <td>{title}</td>\n <td>{utility}</td>\n <td>{latency}</td>\n <td>{latency_p95:.3f}s</td>\n <td>{treasury:.2f}</td>\n <td>{reliability:.2f}</td>\n <td><span class=\"badge {badge}\">{status}</span></td>\n <td><a href=\"{dashboard}\" target=\"_blank\" rel=\"noopener\">Dashboard</a></td>\n </tr>\n \"\"\".format(\n title=payload[\"title\"],\n utility=_format_pct(payload[\"utility_uplift\"]),\n latency=_format_pct(payload[\"latency_delta\"]),\n latency_p95=payload[\"latency_p95\"],\n treasury=payload[\"owner_treasury\"],\n reliability=payload[\"reliability_score\"] * 100,\n badge=guardrail_badge,\n status=\"All Guardrails\" if guardrail_badge == \"pass\" else \"Investigate\",\n dashboard=payload[\"dashboard_path\"],\n )\n )\n\n guardrail_notes = \"\".join(\n f\"<li><strong>{item['title']}</strong>: {', '.join(item['failed'])}</li>\" for item in guardrail_failures\n ) or \"<li>All monitored strategies satisfied guardrails.</li>\"\n\n html = f\"\"\"\n <!DOCTYPE html>\n <html lang=\"en\">\n <head>\n <meta charset=\"utf-8\" />\n <title>Day-One Utility Scoreboard — Command Deck</title>\n <meta name=\"viewport\" content=\"width=device-width, initial-scale=1\" />\n <style>\n :root {{\n color-scheme: dark;\n --bg: #020617;\n --panel: rgba(15, 23, 42, 0.82);\n --accent: #38bdf8;\n --text: #f8fafc;\n }}\n body {{\n margin: 0;\n font-family: 'Space Grotesk', sans-serif;\n background: radial-gradient(circle at top, rgba(56,189,248,0.18), transparent 45%), var(--bg);\n color: var(--text);\n min-height: 100vh;\n display: flex;\n flex-direction: column;\n }}\n header {{\n text-align: center;\n padding: 2.8rem 5vw 1.4rem;\n }}\n header h1 {{\n font-size: clamp(2.6rem, 5vw, 3.8rem);\n margin-bottom: 0.6rem;\n }}\n header p {{\n margin: 0 auto;\n max-width: 70ch;\n color: rgba(248,250,252,0.76);\n line-height: 1.5;\n }}\n main {{\n flex: 1;\n padding: 0 5vw 4rem;\n display: grid;\n gap: 1.4rem;\n }}\n .card {{\n background: var(--panel);\n border-radius: 22px;\n padding: 2rem;\n box-shadow: 0 40px 120px rgba(56,189,248,0.2);\n backdrop-filter: blur(14px);\n }}\n table {{\n width: 100%;\n border-collapse: collapse;\n }}\n th, td {{\n padding: 0.9rem;\n border-bottom: 1px solid rgba(148,163,184,0.24);\n text-align: left;\n }}\n th {{\n text-transform: uppercase;\n letter-spacing: 0.08em;\n font-size: 0.85rem;\n }}\n .badge {{\n display: inline-block;\n padding: 0.2rem 0.7rem;\n border-radius: 999px;\n font-size: 0.75rem;\n letter-spacing: 0.05em;\n }}\n .badge.pass {{\n background: rgba(34,197,94,0.18);\n color: #bbf7d0;\n }}\n .badge.fail {{\n background: rgba(248,113,113,0.2);\n color: #fecaca;\n }}\n ul {{\n margin: 0;\n padding-left: 1.4rem;\n line-height: 1.5;\n }}\n footer {{\n text-align: center;\n padding: 2.4rem 0;\n color: rgba(226,232,240,0.7);\n }}\n a {{\n color: var(--accent);\n }}\n </style>\n </head>\n <body>\n <header>\n <h1>Day-One Utility Scoreboard</h1>\n <p>\n Aggregated telemetry across strategies proves the operator can command\n a sovereign labour market in one sweep. Leaders are crowned live,\n guardrails stay visible, and every dashboard remains one click away.\n </p>\n </header>\n <main>\n <section class=\"card\">\n <h2>Strategy Leaderboard</h2>\n <table>\n <thead>\n <tr>\n <th>Strategy</th>\n <th>Utility Uplift</th>\n <th>Latency Delta</th>\n <th>P95 Latency</th>\n <th>Owner Treasury</th>\n <th>Reliability</th>\n <th>Guardrails</th>\n <th>Explore</th>\n </tr>\n </thead>\n <tbody>\n {''.join(rows)}\n </tbody>\n </table>\n </section>\n <section class=\"card\">\n <h2>Aggregates</h2>\n <ul>\n <li>Total owner treasury impact: {aggregates['total_owner_treasury']:.2f}</li>\n <li>Average utility uplift: {_format_pct(aggregates['average_utility_uplift'])}</li>\n <li>Average latency delta: {_format_pct(aggregates['average_latency_delta'])}</li>\n <li>Average latency P95: {aggregates['average_latency_p95']:.3f}s</li>\n <li>Utility leader: {leaders.get('utility_uplift', {}).get('title', '—')} ({_format_pct(leaders.get('utility_uplift', {}).get('value', {}).get('utility_uplift', 0.0))})</li>\n <li>Treasury leader: {leaders.get('owner_treasury', {}).get('title', '—')} ({leaders.get('owner_treasury', {}).get('value', {}).get('owner_treasury', 0.0):.2f})</li>\n <li>Reliability leader: {leaders.get('reliability', {}).get('title', '—')} ({leaders.get('reliability', {}).get('value', {}).get('reliability_score', 0.0)*100:.2f})</li>\n <li>P95 latency champion: {leaders.get('latency_p95', {}).get('title', '—')} ({leaders.get('latency_p95', {}).get('value', {}).get('latency_p95', 0.0):.3f}s)</li>\n </ul>\n </section>\n <section class=\"card\">\n <h2>Guardrail Watchlist</h2>\n <ul>{guardrail_notes}</ul>\n </section>\n <section class=\"card\">\n <h2>Mermaid Intels</h2>\n <div class=\"mermaid\">{mermaid_blocks.get('treasury', '')}</div>\n <div class=\"mermaid\">{mermaid_blocks.get('leaders', '')}</div>\n <div class=\"mermaid\">{mermaid_blocks.get('guardrails', '')}</div>\n </section>\n </main>\n <footer>\n Generated at {scoreboard['generated_at']} · Powered by AGI Jobs v0 (v2)\n </footer>\n <script type=\"module\">\n import mermaid from 'https://cdn.jsdelivr.net/npm/mermaid@10/dist/mermaid.esm.min.mjs';\n mermaid.initialize({{ startOnLoad: true, theme: 'dark' }});\n </script>\n </body>\n </html>\n \"\"\"\n\n html_path = self.output_dir / \"scoreboard.html\"\n with html_path.open(\"w\", encoding=\"utf-8\") as handle:\n handle.write(html)\n return html_path\n\n # ------------------------------------------------------------------\n # CLI entrypoint\n # ------------------------------------------------------------------\n @classmethod\n def build_parser(cls) -> argparse.ArgumentParser:\n parser = argparse.ArgumentParser(description=\"AGI Jobs Day-One Utility Benchmark\")\n parser.add_argument(\n \"--check\",\n action=\"store_true\",\n help=\"Run the demo in validation mode without writing dashboards or JSON artefacts.\",\n )\n parser.add_argument(\n \"--output-dir\",\n default=None,\n help=\"Override the output directory for generated artefacts and dashboards.\",\n )\n subparsers = parser.add_subparsers(dest=\"command\", required=False)\n\n simulate = subparsers.add_parser(\"simulate\", help=\"Run a day-one utility simulation\")\n simulate.add_argument(\"--strategy\", default=\"e2e\", help=\"Strategy key from strategies.yaml\")\n simulate.add_argument(\n \"--format\",\n choices=(\"json\", \"human\"),\n default=\"json\",\n help=\"Output format for operator consoles. JSON remains automation-friendly, human emits a narrative summary.\",\n )\n\n owner = subparsers.add_parser(\"owner\", help=\"View or update owner controls\")\n owner.add_argument(\"--show\", action=\"store_true\", help=\"Display the current owner configuration\")\n owner.add_argument(\"--set\", nargs=2, metavar=(\"KEY\", \"VALUE\"), help=\"Update a specific owner control\")\n owner.add_argument(\n \"--toggle-pause\", action=\"store_true\", help=\"Toggle the paused state for the orchestrator\"\n )\n owner.add_argument(\n \"--reset\", action=\"store_true\", help=\"Restore owner controls to the default sovereign configuration\"\n )\n\n subparsers.add_parser(\"list\", help=\"List available strategies\")\n scoreboard = subparsers.add_parser(\n \"scoreboard\", help=\"Generate a multi-strategy scoreboard and dashboard\"\n )\n scoreboard.add_argument(\n \"--strategies\",\n nargs=\"*\",\n help=\"Optional list of strategy keys to include (defaults to all)\",\n )\n scoreboard.add_argument(\n \"--format\",\n choices=(\"json\", \"human\"),\n default=\"json\",\n help=\"Set to 'human' for a concise console summary\",\n )\n return parser\n\n def execute(self, args: Optional[Sequence[str]] = None) -> Tuple[Mapping[str, Any], str]:\n parser = self.build_parser()\n parsed = parser.parse_args(args=args)\n command = parsed.command or \"simulate\"\n write_artifacts = not bool(getattr(parsed, \"check\", False))\n if parsed.output_dir:\n self.output_dir = Path(parsed.output_dir).expanduser()\n if write_artifacts:\n self._ensure_output_dir(self.output_dir)\n if command == \"simulate\":\n report = self.simulate(parsed.strategy, write_artifacts=write_artifacts)\n output_format = getattr(parsed, \"format\", \"json\")\n if output_format == \"human\":\n summary = self._build_human_summary(report)\n return {\"report\": report, \"summary\": summary}, \"human\"\n return report, \"json\"\n if command == \"owner\":\n if parsed.reset:\n snapshot = self.reset_owner_controls()\n return {\"owner_controls\": snapshot, \"status\": \"reset\"}, \"json\"\n if parsed.toggle_pause:\n snapshot = self.toggle_pause()\n return {\"owner_controls\": snapshot}, \"json\"\n if parsed.set:\n key, value = parsed.set\n snapshot = self.update_owner_control(key, value)\n return {\"owner_controls\": snapshot}, \"json\"\n snapshot = self.load_owner_controls()\n return {\"owner_controls\": snapshot}, \"json\"\n if command == \"list\":\n strategies = {key: profile.title for key, profile in self.load_strategies().items()}\n return {\"strategies\": strategies}, \"json\"\n if command == \"scoreboard\":\n strategy_args = getattr(parsed, \"strategies\", None)\n scoreboard_payload = self.scoreboard(strategy_args, write_artifacts=write_artifacts)\n output_format = getattr(parsed, \"format\", \"json\")\n if output_format == \"human\":\n summary = self._build_scoreboard_human_summary(scoreboard_payload)\n return {\"scoreboard\": scoreboard_payload, \"summary\": summary}, \"human\"\n return scoreboard_payload, \"json\"\n raise ValueError(f\"Unknown command {command}\")\n\n def _build_human_summary(self, report: Mapping[str, Any]) -> str:\n profile = report[\"strategy_profile\"]\n metrics = report[\"metrics\"]\n thermodynamics = report[\"thermodynamics\"]\n guardrails = report[\"guardrail_pass\"]\n owner_snapshot = report[\"owner_controls\"]\n utility_pct = metrics[\"utility_uplift\"] * 100\n latency_pct = metrics[\"latency_delta\"] * 100\n lines = [\n f\"Strategy: {profile['title']} ({report['strategy']})\",\n f\"Utility uplift: {utility_pct:.2f}% — Guardrail {'PASSED' if guardrails['utility_uplift'] else 'BLOCKED'}\",\n f\"Latency delta: {latency_pct:.2f}% — Guardrail {'PASSED' if guardrails['latency_delta'] else 'BLOCKED'}\",\n f\"P95 latency: {metrics['latency_p95']:.3f}s\",\n f\"Reliability score: {profile['reliability_score']*100:.1f} — {'Operational' if guardrails['reliability_score'] else 'Investigate'}\",\n f\"Owner treasury (fees + bonuses): {metrics['owner_treasury']:.2f}\",\n (\n \"Thermodynamics: \"\n f\"free energy margin {thermodynamics['free_energy_margin']:.2f}, \"\n f\"Gibbs {thermodynamics['gibbs_free_energy']:.2f}, \"\n f\"Hamiltonian stability {thermodynamics['hamiltonian_stability']*100:.1f}%.\"\n ),\n (\n \"Thermo slack: \"\n f\"entropy {thermodynamics['entropy_margin_sigma']:.2f}σ · \"\n f\"game-theory slack {thermodynamics['game_theory_slack']*100:.1f}% · \"\n f\"temperature {thermodynamics['temperature']:.2f}.\"\n ),\n \"Highlights:\",\n ]\n for bullet in profile[\"highlights\"]:\n lines.append(f\" • {bullet}\")\n action_path = report.get(\"action_path\", [])\n if action_path:\n lines.append(\"Action path:\")\n for step in action_path[:3]:\n lines.append(f\" • {step['sequence']}. {step['title']}\")\n outputs = report.get(\"outputs\", {})\n dashboard = outputs.get(\"dashboard\") or \"N/A (check mode)\"\n chart = outputs.get(\"chart\") or \"N/A (check mode)\"\n lines.extend(\n [\n \"Owner controls:\",\n f\" • Owner: {owner_snapshot['owner_address']}\",\n f\" • Treasury: {owner_snapshot['treasury_address']}\",\n f\" • Platform fee: {owner_snapshot['platform_fee_bps']} bps\",\n f\" • Utility guardrail: {owner_snapshot['utility_threshold_active']:.4f}\",\n f\" • Latency guardrail: {owner_snapshot['latency_threshold_active']}\",\n f\" • Narrative: {owner_snapshot['narrative']}\",\n \"Outputs:\",\n f\" • Dashboard: {dashboard}\",\n f\" • Snapshot: {chart}\",\n ]\n )\n return \"\\n\".join(lines)\n\n def _build_scoreboard_human_summary(self, payload: Mapping[str, Any]) -> str:\n leaders = payload[\"leaders\"]\n aggregates = payload[\"aggregates\"]\n guardrail_failures = payload.get(\"guardrail_failures\", [])\n\n lines = [\n \"Day-One Utility Scoreboard\",\n \"Leaders:\",\n f\" • Utility uplift: {leaders['utility_uplift']['title']} ({leaders['utility_uplift']['value']['utility_uplift']*100:.2f}%)\",\n f\" • Treasury: {leaders['owner_treasury']['title']} ({leaders['owner_treasury']['value']['owner_treasury']:.2f})\",\n f\" • Reliability: {leaders['reliability']['title']} ({leaders['reliability']['value']['reliability_score']*100:.1f})\",\n f\" • Latency delta: {leaders['latency_delta']['title']} ({leaders['latency_delta']['value']['latency_delta']*100:.2f}%)\",\n f\" • P95 latency: {leaders['latency_p95']['title']} ({leaders['latency_p95']['value']['latency_p95']:.3f}s)\",\n \"Aggregates:\",\n f\" • Total owner treasury: {aggregates['total_owner_treasury']:.2f}\",\n f\" • Average utility uplift: {aggregates['average_utility_uplift']*100:.2f}%\",\n f\" • Average latency delta: {aggregates['average_latency_delta']*100:.2f}%\",\n f\" • Average P95 latency: {aggregates['average_latency_p95']:.3f}s\",\n ]\n\n if guardrail_failures:\n lines.append(\"Guardrail alerts:\")\n for failure in guardrail_failures:\n failed_list = \", \".join(failure[\"failed\"])\n lines.append(f\" • {failure['title']} ({failure['strategy']}): {failed_list}\")\n\n dashboard = payload.get(\"outputs\", {}).get(\"dashboard\") or \"N/A (check mode)\"\n lines.append(f\"Dashboard: {dashboard}\")\n return \"\\n\".join(lines)\n\n\ndef run_cli(args: Optional[Sequence[str]] = None) -> Tuple[Mapping[str, Any], str]:\n \"\"\"Run the demo CLI with backwards-compatible argument handling.\"\"\"\n\n orchestrator = DayOneUtilityOrchestrator()\n normalized_args: Optional[List[str]]\n\n if args is None:\n # Read from sys.argv so we can normalise old-style invocations such as\n # `python run_demo.py --strategy e2e` which predate the subcommand\n # interface. We normalise rather than rely on argparse errors so the\n # CLI feels forgiving to non-technical operators following earlier docs.\n normalized_args = list(sys.argv[1:])\n else:\n normalized_args = list(args)\n\n if normalized_args is None:\n return orchestrator.execute(None)\n\n global_args: List[str] = []\n remainder: List[str] = []\n idx = 0\n while idx < len(normalized_args):\n token = normalized_args[idx]\n if token == \"--check\":\n global_args.append(token)\n idx += 1\n continue\n if token == \"--output-dir\":\n global_args.append(token)\n if idx + 1 < len(normalized_args):\n global_args.append(normalized_args[idx + 1])\n idx += 2\n continue\n remainder.append(token)\n idx += 1\n continue\n remainder.append(token)\n idx += 1\n\n if not remainder:\n remainder = [\"simulate\"]\n else:\n primary = remainder[0]\n known_commands = {\"simulate\", \"owner\", \"list\", \"scoreboard\"}\n if primary not in known_commands and not primary.startswith(\"-\"):\n # Allow operators to call `python run_demo.py e2e` and treat the\n # first positional argument as the strategy name. This mirrors the\n # friendly interface described in the scaffold request.\n remainder = [\"simulate\", \"--strategy\", primary, *remainder[1:]]\n elif primary.startswith(\"-\"):\n # Any flag-only invocation should default to the simulate command.\n remainder = [\"simulate\", *remainder]\n\n return orchestrator.execute([*global_args, *remainder])\n\n\ndef main() -> None:\n payload, format_hint = run_cli()\n if format_hint == \"human\":\n summary = payload.get(\"summary\", \"\")\n print(summary)\n else:\n print(json.dumps(payload, indent=2))\n\n\nif __name__ == \"__main__\": # pragma: no cover - CLI entrypoint\n main()\n","format":"text","sha256":"e9f1a9a3d375ecd04b92c3e9ab7374b3fea34749d12f76b36bcdcd1006e633fc","bytes":70905,"download":"/AGIJobsv0/examples/e9f1a9a3d375ecd0-demo_runner.py","source":"https://github.com/MontrealAI/AGIJobsv0/blob/5b4cebb309a83a7a6749d8911d8bf96a1921e042/demo/AGIJobs-Day-One-Utility-Benchmark/demo_runner.py"}]}
FROM READING TO A REPRODUCIBLE RUN
Try the selected path.
Isolated Python environment
Use Python 3.12 in a virtual environment. Install this demo’s tracked requirements file when present, then run python -m pip check. Some variants have additional requirements: follow the selected implementation’s guide, not an unrelated demo’s dependency list.
A scoreboard and per-strategy reports are produced in /tmp/day-one-demo. Read acceptance, cost and latency together with the configured rules.
The source inspector above reads bundled repository material. Local commands run separately on your computer. Recorded examples may contain historical timestamps, placeholders and simulated metrics.
MAKE IT YOUR OWN
One useful experiment.
Change a multiplier in a copied fixture and observe the scoreboard. Explain why this sensitivity test does not validate the multiplier itself.
THE SYSTEM, MADE VISIBLE
Architecture & relationships
Architecture diagram · source preserved belowView original Mermaid source
flowchart LR
Operators((Mission Owners)) --> demo_AGIJobs_Day_One_Utility_Benchmark[[Demo → AGIJobs Day One Utility Benchmark]]
demo_AGIJobs_Day_One_Utility_Benchmark --> Core[[AGI Jobs v0 (v2) Core Intelligence]]
Core --> Observability[[Unified CI / CD & Observability]]
Core --> Governance[[Owner Control Plane]]
WHEN SOMETHING DOESN’T MATCH
Troubleshooting
Import or dependency error
Confirm the active virtual environment and the selected demo’s requirements. Run python -m pip check; do not install unrelated demo requirements over a working environment.
Unexpected result or missing file
Check the selected entry point, configuration and output argument. Keep the seed and implementation fixed before comparing outcomes.
TRACE THE CHECKS
Verification & next steps
1 tracked test source files are available in this directory. Inspect the tests and their environment before choosing a suite; file counts do not establish test results.