# WHO PAYS 广州高密核心区：逐轮决策、参数、公开数据与现实验证说明

版本：`guangzhou-liqiu@1.0.0-research`  
更新日期：2026-08-13  
适用场景：`WHO-PAYS-GUANGZHOU-LIQIU-V1`  
结论等级：`partially_calibrated_research`，只能做机制比较，不是广州现实预测

## 1. 先给出不含糊的结论

本次改造后的三套系统按同一条状态链运行：参与方配置创建世界，主体圆桌分三轮提交受约束的政策意图，城市结果在每轮之后推进 ABM、账本和主体状态。三套系统共享 `simulationId`，每次写入都校验最新 `worldVersion`；旧版本写入返回冲突而不是静默覆盖。

广州官方数据现在是城市尺度、区级人口密度、收入、餐饮行业边界和最低工资的首要依据。美团研究数据只提供匿名中等城市的日内需求形状与履约分布迁移先验；它不是广州数据。LaDe 上海数据不进入广州基准，只保留为未来跨城外部验证。没有广州本地观测的数据均保留为区间、理论先验或压力测试，不把单点值描述成现实事实。

当前场景包含真实数据约束，也包含未被广州微观数据识别的参数。因此允许回答“在这些公开边界、行为设定和压力参数下，成本如何传导”，不允许回答“广州当天一定会产生多少订单、平台真实预算是多少、社会损失是多少”。

## 2. 三套系统的唯一上下文与数据共享

### 2.1 主键

一场实验以以下字段共同定位：

```text
simulationId
├── branchId=policy：参与方配置、三轮圆桌政策、LLM 战略动作、ABM、账本
└── branchId=baseline：同一初态、同一 seed，不接收政策动作

scenarioVersion + actorConfigVersion + roundtableRunId + policyBundleId
+ tick + worldVersion + stateHash + seed
```

- `simulationId`：三页共同使用的实验 ID。
- `worldVersion`：乐观锁。每个被接受的主体动作、政策包或世界推进都会递增版本。
- `stateHash`：当前完整状态的稳定哈希，用于回放核对。
- `seed`：固定消费者异质性、社交图、门店成本抽样和其他随机序列。
- `branchId`：policy 与 baseline 隔离；不得把政策分支结果写回基线。

### 2.2 页面之间实际传递什么

| 来源页面 | 写入对象 | 下游读取 | 不允许做的事 |
| --- | --- | --- | --- |
| 参与方配置 | `ActorConfiguration`、目标权重、允许 Skills、信息权限、执行强度 | 圆桌、城市结果 | 前端直接改订单、利润或风险 |
| 主体圆桌 | `RoundtableTurnRecord`、受守卫的 `PolicyBundle`、联盟回执 | 下一轮圆桌、城市结果 | LLM 自由生成金额并直接改账本 |
| 城市结果 | 世界快照、事件流、复式账本、policy/baseline 对照 | 下一轮圆桌、报告 | 用旧 `worldVersion` 覆盖新世界 |

Data Reports 与 Workbench 页面当前冻结。后端接口、广州场景和共享上下文已经可用，但这两个页面的布局、字段位置和合并逻辑不在本轮改动范围内。

## 3. 逐轮运行顺序、时间周期与写入内容

### 3.1 计算时间

- 样本世界：10:00—22:00，共 12 小时。
- 1 tick = 5 分钟。
- 完整 horizon = 144 ticks。
- 圆桌的阶段观察点：T+0、T+24、T+48、T+72。
- T+24 表示 120 个模拟分钟，不代表现实日历上的 24 小时。
- 圆桌页面另有“三天/三年”的叙事标签；它只决定语言讨论的政策时间视角，不应被误解为 ABM 的物理时间。新版 Workbench 需要把这两个时钟明确分开。

### 3.2 配置阶段：T+0

输入：

- 广州场景版本与固定 seed。
- 3 个合成平台原型、4 个合成品牌原型、20 家门店、36 个骑手、120 个消费者和政府部门。
- 主体目标、Skill 白名单、证据门槛、执行强度、信息可见性。
- 144 个五分钟需求倍率、活动冲击、门店产能、骑手约束、政府监测窗口。

执行：

1. 创建 `policy` 世界。
2. 从同一初态 fork `baseline` 世界。
3. 返回同一 `simulationId` 下两个 branch 的 `worldVersion/stateHash`。
4. 页面保存配置快照，后续圆桌只能引用该 `actorConfigVersion`。

### 3.3 第一轮：开场立论 → T+24

每个主体只看自己的信息集、获授权公共指标和历史事件，独立输出：主张、机制、证据类型、不确定性、候选动作和置信度。主体不能看到同轮其他发言。

写入顺序：

1. 发言写入长期记忆和 `RoundtableTurnRecorded`。
2. 证据门槛、Skill 权限与置信度全部通过时，发言被编译为第一轮政策包；否则仅观察，不写动作。
3. LLM 只选择方向；券面额、数量和派单压力等数值由冻结候选集、目标函数和硬约束决定。
4. policy 分支应用动作；baseline 保持不应用圆桌动作。
5. 两个分支都推进到 T+24。
6. 返回新 `worldVersion`、订单、履约、账本、风险、利润和信心。

第二轮必须读取 T+24 的实际样本世界指标，不再只看初始演示索引。

### 3.4 第二轮：点名交锋 → T+48

主体必须回应第一轮具体 turn ID，说明分歧、让步条件、会改变立场的可观测阈值和信息缺口。输入中包括 T+24 最新的 `simulationId/tick/worldVersion/metrics`。

写入与推进顺序和第一轮相同。通过守卫的第二轮候选动作形成独立政策包，随后两个分支推进至 T+48。第三轮读取的是 T+48 的真实样本世界结果和两轮长期记忆。

### 3.5 第三轮：确认方案 → T+72

主体给出条件性收束和权限内动作。系统可以在满足支持阈值时形成联盟，再编译 closing 政策包。所有动作仍逐项经过 handler 守卫；一项被拒绝不等于整场对话伪装成功，回执会列出 rejected intent。

policy 与 baseline 推进到 T+72，城市结果可继续推进到 T+144。T+24、T+72 可触发战略 LLM 窗口；T+144 是终点，不再触发终点后的新动作。

### 3.6 失败和并发规则

- 提交时 `expected_world_version` 与服务器不一致：HTTP 409，用户必须刷新。
- 同一个 idempotency key 重试：返回原回执，不重复扣款或重复发券。
- handler 失败：恢复动作前的世界、账本、披露和选择集。
- 账本借贷不平：完整运行失败。
- LLM 超时或输出不可解析：战略窗口回退为 `hold`，不自由猜测动作。

### 3.7 每一轮的完整决策包

三轮不是连续生成三段文案，而是三个“观察—提议—守卫—写入—推进—回执”事务。每轮的输入和输出如下。

| 字段 | opening | rebuttal | closing |
| --- | --- | --- | --- |
| 观察时点 | T0 / 10:00 | T24 / 12:00 | T48 / 14:00 |
| 决策结算点 | T24 / 12:00 | T48 / 14:00 | T72 / 16:00 |
| 必带身份 | `simulationId, branchId, roundtableRunId, actorConfigVersion, scenarioVersion, seed` | 同左 | 同左 |
| 并发守卫 | T0 最新 `expected_world_version` | T24 最新版本 | T48 最新版本 |
| 主体可见输入 | 自身私有切片、T0 公共指标、来源清单、授权 Skill | T24 指标与 opening turn IDs、执行回执、信息缺口 | T48 指标、两轮记忆、联盟支持度、未满足条件 |
| 主体必须输出 | 主张、机制、证据类型、未知项、候选 Skill、置信度 | 点名回应 turn ID、同意/反对、可改变立场的阈值、候选 Skill | 条件性立场、最终候选 Skill、失败退出条件、剩余异议 |
| LLM 能做 | 解释和提议白名单 ID | 基于新观察更新主张 | 条件性收束与解释 |
| LLM 不能做 | 直接产生可结算金额、改权重、改账本 | 使用对手隐藏预算、伪造新观测 | 绕过联盟门槛或硬约束 |
| 确定性层 | 权限、证据阈值、输入 schema、预算、安全、Pareto 与配置分数 | 同左，并核对回应引用 | 同左，并核对联盟门槛与条件 |
| 写入 | turn、memory、belief、policy bundle、handler receipts、events、ledger | 同左 | 同左 |
| 下一轮读取 | T24 policy/baseline 差异 | T48 policy/baseline 差异 | T72 结果；T73—T144 只结算/观察 |

一个可执行 turn 的最小结构：

```json
{
  "simulation_id": "official-guangzhou-llm-e2e-20260813-1315",
  "branch_id": "policy",
  "roundtable_run_id": "ROUND-MSR2B9W4",
  "phase": "rebuttal",
  "turn_id": "TURN-...",
  "agent_id": "platform-a",
  "tick": 24,
  "expected_world_version": "w412",
  "visible_field_ids": ["own_budget", "public_fulfillment", "public_rider_risk"],
  "hidden_field_ids": ["rival_private_budget", "individual_rider_trace"],
  "reply_to_turn_ids": ["TURN-OPENING-..."],
  "proposed_action": {"skill_id": "SKILL-PLATFORM-SET-COUPON", "candidate_id": "CANDIDATE-..."},
  "confidence": 0.72,
  "source_ids": ["SRC-CN-SUBSIDY-DRAFT-2026"]
}
```

这里的 `confidence` 是主体对主张的结构化置信度，不是经济结果；金额仍由候选集和 handler 计算。

### 3.8 前两轮如何实时改变后续数据

每轮动作首先成为事件和复式账本交易，然后在后续 ticks 中通过四条反馈链展开：

```text
补贴/成本分摊 → 消费者实付价与平台/商户现金 → 选择概率、预算可行性
派单压力/休息护栏 → 接单概率、疲劳、风险代理 → 履约、拒单、下一轮公共指标
门店限单/增员 → 服务率与队列 → 预计等待、完成率、商户利润
模拟发帖/转发 → 有界 social_demand_signal → 下一 tick 下单概率
```

状态共享不是三个页面互相复制 JSON。配置页、圆桌和城市结果都从引擎读取同一 session；只有引擎能递增 `worldVersion`。前端缓存只能用于展示，不能作为下一轮的数值真相。

## 4. 数据目录与进入计算的方式

| 路径 | 内容 | 是否部署原始数据 | 如何进入计算 |
| --- | --- | --- | --- |
| `calibration/guangzhou-public-moments.json` | 广州 11 区密度、收入、餐饮行业、最低工资 | 是，公开聚合 | 城市权重、预算尺度、成本/工资边界 |
| `calibration/meituan-anonymous-city-moments.json` | 匿名中等城市 8 天聚合需求和履约分布 | 只部署聚合，不部署原始 CSV | 144-bin 日内形状、履约目标矩、Transformer 留出测试 |
| `calibration/guangzhou-traffic-speed-moments.json` | 广州 2016 年 61 天、214 条匿名道路的十分钟速度聚合 | 只部署聚合，不部署原始 CSV | 仅用于广州历史拥堵相对形状压力测试；不作骑手速度 |
| `calibration/parameter-register.json` | 每个参数的状态、变换、允许/禁止声称 | 是 | 报告可信度门禁 |
| `calibration/parameter-coverage-report.json` | 场景全部数值叶子的参数归属 | 是 | 1,429/1,429 覆盖门禁 |
| `scenarios/delivery-war-guangzhou-liqiu-v1.json` | 可运行场景 | 是 | ABM 冻结输入 |
| `agent-foundry/sources/source-registry.json` | 理论、法规、财报、公开数据注册表 | 是 | 来源完整性审计，不自动产生参数 |
| `agent-foundry/actors/` | 主体、组织与权限 | 是 | 初始主体配置 |
| `agent-foundry/skills/` | 38 个 Skill 契约和守卫 | 是 | LLM 动作白名单 |
| `agent-foundry/policies/` | 平台与政府目标/候选集 | 是 | 条件性 Pareto 选择 |
| `runtime/` | snapshot、events、ledger、验证结果 | 运行生成 | 回放、审计、报告 |
| `benchmarks/results/forecast-model-suite.json` | 8 个一步预测模型与 3 个日提前模型 | 是 | 同信息集时间留出对照 |
| `benchmarks/results/llm-decision-guard.json` | DeepSeek/MiniMax 12 个政策选择实测 | 是 | 原始提议与守卫后结果分栏 |
| `benchmarks/simulator-capability-protocol.json` | WHO PAYS、MiroFish、AgentSociety 2、Mesa、GAMA 能力证据 | 是 | executed/source-verified/blocked，不做主观总分 |

原始美团 ZIP 位于本机忽略目录，只由 `scripts/calibrate_public_data.py` 读取；其许可是 CC BY-NC 4.0 并带仓库非再分发要求。官网不部署原始行级数据。

## 5. 公开数据清单与严格用途边界

### 5.1 广州首要校准来源

| source ID | 公开观测 | 本模型用途 | 不能推出 |
| --- | --- | --- | --- |
| `SRC-GZ-YEARBOOK-DENSITY-2025` | 2024 年广州面积、常住人口、11 区密度 | 选择荔湾、越秀、海珠、天河高密核心；形成相对权重 | 外卖订单密度、真实路网 |
| `SRC-GZ-YEARBOOK-INCOME-2025` | 人均可支配收入 77,804 元、消费支出 47,710 元及区级收入 | 消费预算相对尺度 | 单个用户奶茶预算 |
| `SRC-GZ-YEARBOOK-CATERING-2025` | 限额以上饮料冷饮与外卖送餐法人企业聚合财务 | 行业尺度和商户成本上界核对 | 每杯直接材料成本、全行业总体 |
| `SRC-GZ-MIN-WAGE-2025` | 2025-03-01 起月最低工资 2,500 元、非全日制小时 23.7 元 | 临时用工工资硬下界 | 茶饮店市场平均工资 |

核心区官方密度：荔湾 19,205 人/平方公里、越秀 28,994、海珠 19,579、天河 23,286。场景权重只在这四区内归一；其他 7 区仍保存在校准文件中，但不进入当前高密核心服务单元。

### 5.2 美团匿名城市迁移先验

研究数据覆盖 2022-10-17 至 2022-10-24：654,343 条运单行、568,546 个唯一订单、23 个商圈、4,962 个商家、4,955 个骑手。论文明确描述为中国匿名中等城市，坐标经过平移。

当前聚合包含完整 24 小时 288 个五分钟 bins，同时保留 10:00—22:00 的 144-bin 活动世界切片。可用：

- 10:00—22:00 的 144 个五分钟相对需求倍率；均值归一为 1。
- 订单至取餐、订单至送达的分布目标矩。
- 匿名城市内的时间留出预测基准。

不可用：

- 广州空间密度、广州路网、广州订单总量。
- 平台定价、平台预算、商户成本或广州现实预测。
- 由匿名坐标识别真实商家、骑手或区域。

订单至送达迁移目标：p50=28.1 分钟、p90=48.267 分钟、p95=56.2 分钟。它用于检查模型是否明显过快或过慢，不是广州达标线。

聚合脚本还保留而不部署原始行的履约矩：运单行接受率 0.868881，订单至派单 p50=2.917 分钟，订单至取餐 p50=13.483，取餐至送达 p50=13.45，订单至送达 p50=28.417；无缓冲超时比 15.0078%，八分钟缓冲后 1.9167%。这些数只描述该匿名研究城市。

### 5.3 广州交通与公开社交迁移边界

广州交通速度数据覆盖 2016-08-01 至 2016-09-30，214 条匿名道路、61 天、十分钟粒度、1,855,589 条非零速度观测，主要是快速路和主干道。全样本速度 p50=39.374 km/h；17—18 时的聚合速度明显低于凌晨。模型只允许使用“日内相对拥堵形状”。18 km/h 骑手参数不能由机动车道路 p50 证明，仍必须标为合成敏感性参数。2026 年 4 月广州交通月报只用于核对晚高峰拥堵方向和当前背景。

公开 Higgs Twitter 数据只提供跨平台、跨国家、跨年代的网络拓扑与级联量级压力先验。它不识别广州消费者关系、转发率或社交曝光对下单的因果弹性，因此社交参数全部维持 `theory_prior`。

### 5.4 上市公司与活动资料

- `SRC-DATA-CHAGEE-20F-2025`：原材料、包装、仓储物流占收入的公开比率只约束直接材料先验；集团和加盟收入结构不允许直接换算成广州单杯成本。
- `SRC-DATA-MEITUAN-ANNUAL-2025`：集团收入、亏损、营销费用、现金和骑手收入范围只用于平台压力情景与骑手收入尺度核对；不能反推广州单城预算。
- `SRC-EVENT-MEITUAN-LIQIU-2024`、`SRC-EVENT-CHAGEE-LIQIU-2025`：支持立秋活动具有方向性冲击；不识别广州 2026 的 1.34 倍因果效果。1.34 被明确登记为压力系数。

### 5.5 理论来源

- McFadden 离散选择与 QRE：决定有限理性选择形式，不提供广州数值。
- Rochet–Tirole 双边市场：决定平台、商户、消费者之间的价格与补贴传导结构。
- 排队模型：决定门店队列、服务率和等待的关系。
- Rahmandad & Sterman 2008：支持个体异质性、网络拓扑和随机结果分布对扩散的重要性。它不提供广州社交度数或转发率。
- RIA：支持政府对收益、成本、约束和不确定性做结构化比较，不提供广州财政预算。

### 5.6 广州政府组织来源

政府主体的职责与协商边界已切换到广州官方资料：广州市人民政府工作规则、广州市市场监督管理局、商务局、人力资源和社会保障局、交通运输局、财政局的公开职责。它们只支持“哪些部门可以观察、建议、审查或在职责内行动”的边界，不识别模型里的权重、预算、容量、否决阈值或决策速度；六节点组织仍是研究抽象，不代表广州市真实议事机构设置。

## 6. 当前完整参数登记

机器门禁已扫描场景的全部 1,429 个数值叶子：1,429 个命中参数登记，未覆盖 0、重复归属 0、未知 source ID 0。这个 100% 表示“每个数都有性质、来源/理论或压力测试说明”，不表示 100% 已被现实识别。

20 个参数组为：时钟/seed、抽象城市图、平台资产负债、代表性人口、商户单位经济、消费者预算、骑手事故压力、商户爆单压力、消费者边缘行为、需求选择、履约能力、劳动安全、活动经济计算器、候选网格、事件冲击、政府护栏、广州城市画像、品牌原型份额、需求观测迁移、社交网络迁移。完整的路径、测试区间、允许和禁止声称以 `calibration/parameter-register.json` 为准。

### 6.1 人口与层级

| 参数 | 基准 | 状态 | 说明 |
| --- | ---: | --- | --- |
| 平台 | 3 | stress-test classes | A 增长、B 均衡、C 稳健，均为合成原型 |
| 品牌 | 4 | synthetic archetype | 高端 20%、大众 30%、性价比 30%、独立 20% |
| 门店 | 20 | representative micro-sample | 每店绑定 brandId 和 districtId |
| 骑手 | 36 | representative micro-sample | 不外推广州总骑手数 |
| 消费者 | 120 | representative micro-sample | 不外推广州总订单 |
| 城市放大系数 | 空 | deliberately unavailable | 防止把样本钱数冒充广州总量 |

### 6.2 平台

| 平台 | 合成现金（分） | 批准亏损预算（分） | 初始派单压力 | 目标画像 |
| --- | ---: | ---: | ---: | --- |
| A | 52,000,000 | 4,500,000 | 0.50 | growth_sprint |
| B | 46,000,000 | 3,000,000 | 0.43 | balanced |
| C | 38,000,000 | 1,500,000 | 0.36 | profit_recovery |

这些金额是正规化的压力预算档位，不是任一真实平台的广州预算。敏感性检验为预算整体乘 0.5 与 2.0。

补贴候选：

| 候选 | 券面额（分） | 数量 | 商户分摊 | 派单压力 | 备注 |
| --- | ---: | ---: | ---: | ---: | --- |
| aggressive | 900 | 600 | 15% | 0.72 | 可被预算/安全约束拒绝 |
| moderate | 500 | 700 | 20% | 0.58 | 商户分摊仅压力测试 |
| disciplined | 200 | 700 | 10% | 0.45 | 较保守 |
| no subsidy | 0 | 0 | 0 | 0.38 | 基线候选 |
| reckless burn | 2,000 | 5,000 | 40% | 0.95 | 故意设置的不可行候选，应被硬约束淘汰 |

### 6.3 商户、骑手、消费者、社交和政府

| 参数 | 基准 | 检验范围/状态 |
| --- | ---: | --- |
| 商户初始现金 | 180,000 分 | 合成样本尺度 |
| 标价 | 2,200—4,200 分 | 场景范围 |
| 佣金率 | 12% | 压力参数，不是现实合同 |
| 直接变动成本率 | 38%—55% | 公开财务边界；抽样后固定 |
| 门店服务能力 | 1—3 单/tick | 队列压力参数 |
| 基础出餐 | 4 ticks=20 分钟 | 按匿名城市履约分布诊断后选定；检验 2—4 ticks |
| 骑手速度 | 18 km/h | 情景参数，非广州实测均速 |
| 每单骑手支付 | 600 分 | 合成转移，不是资源成本 |
| 疲劳休息阈值 | 0.72 | 理论/压力参数 |
| 风险硬上限 | 0.90 | 代理指标约束，不是事故概率 |
| 消费者初始预算 | 22,000 分 | 广州收入尺度的相对化样本值 |
| 基础下单概率 | 0.025/人/tick | 未被广州订单数据识别 |
| 活动冲击 | T12—T42，1.34 倍 | stress-test only；检验 1.0/1.7 |
| 社交图 | Watts–Strogatz | 固定 seed 的合成图，不是真实关系 |
| 平均度数 | 6 | 检验 4—10 |
| 重连概率 | 0.12 | 检验 0.05—0.30 |
| 基础转发概率 | 0.05 | 检验 0.02—0.12 |
| 社交需求弹性 | 0.25 | 理论先验；检验 0—0.40 |
| 社交信号逐 tick 衰减 | 0.92 | 理论先验；检验 0.80—0.98 |
| 骑手外生事故率 | 0 | 无广州观测，基准关闭 |
| 消费者投机者比例 | 0 | 无广州观测，基准关闭 |
| 跨平台错拿概率 | 0 | 无广州观测，基准关闭 |
| 政府直接财政预算/整改行政成本 | 0 | 基准仅规则护栏，不伪造广州财政支出 |
| 平台整改合规成本 | 50,000 分 | 平台压力参数，不是社会损失 |

## 7. 智能体如何配置、看到什么、如何决策

### 7.1 共同约束

每个主体有目标、可调用 Skill、执行强度、证据门槛、长期记忆、信念、关系和学习状态。LLM 只生成结构化选择和可审计理由，不提供隐藏思维过程，也不能直接修改数值状态。

### 7.2 平台智能体

可见：自身现金、补贴支出、订单、履约、公共风险和信心。不可见：其他平台私有预算与算法、个人轨迹。先过滤预算、现金跑道、披露和安全硬约束，再在可行 Pareto 候选中按画像选最高分。

平台每单现金结果：

```text
平台利润增量 = 佣金 - 平台承担补贴 - 骑手支付 - 已记录平台运营成本
```

### 7.3 商户智能体

可见：自身队列、现金、库存、平台规则、公开订单和等待。不可见：平台私有预算、其他商户私有成本。队列超过阈值后，可以在工资下界与现金约束内临时增员，否则限单。

```text
商户现金利润增量
= 标价 - 商户承担补贴 - 平台佣金 - 直接变动成本 - 临时用工
```

### 7.4 骑手智能体

可见：自身疲劳、路线、收入、活动订单和公共履约。接单概率：

```text
p_accept = clamp(
  0.18 + 0.55×可靠性 + 0.22×风险容忍 + 0.22×派单压力
  - 0.58×疲劳 - 距离/18000,
  0.05, 0.98
)
```

`risk_proxy = fatigue_index × effective_dispatch_pressure` 只用于场景间比较，不是事故概率或健康诊断。基准关闭外生事故，但内生疲劳和休息仍运行。

### 7.5 消费者智能体

没有进行中订单且预算充足时，按基础概率、144-bin 分时倍率、活动冲击和上一时点的社交需求信号进入选择：

```text
p_order' = clamp(
  p_order × (1 + 0.25 × social_demand_signal × 个体从众敏感度),
  0, 1
)
```

`social_demand_signal` 由带方向的模拟发帖/转发更新，限制在 [-1,1]，每 tick 乘 0.92 衰减。这样前一轮行为能改变后一轮下单流，但 0.25 和 0.92 是敏感性先验，不是广州真实社交媒体的因果估计。

进入报价集合后的选择效用：

```text
U = 4×品质
  - 个体价格权重×实付价格
  - 个体等待权重×预计等待
  + 平台熟悉度
  + 0.7×平台信任
  + 个体补贴注意度×补贴/500
  + 个体从众敏感度×门店活动热度
  + 固定种子随机扰动
```

选择用 softmax/QRE，不假设完全理性。等待超过个体耐心后会降低信任，并可能在合成社交图中发布带 `[模拟内容]` 标签的负面体验；内容方向和转发暴露通过上述有界弹性影响后续下单概率，而不会直接写订单、利润或账本。

### 7.6 政府智能体

商务、市场监管、人社、交通、财政和联合协调分别按职责读取聚合信息。政府每 12 ticks 监测一次，比较继续观察与规制护栏候选；政策选择是给定候选、权重和约束下的条件最优，不是现实政府偏好或法律认定。

## 8. 经济模型、ABM 与 LLM 的分工

经济模型负责可计算关系：选择、队列、双边市场、现金流、资源成本、疲劳风险代理、政策目标。ABM 负责个体异质性、空间节点、社交网络、交互次序、记忆、学习和涌现分布。LLM 负责在有限信息集内提出主张、更新信念、选择白名单动作和说明不确定性。

不能让 LLM 直接算账的原因：相同发言可能得到不平衡或不可回放的金额。不能只用传统 ABM 的原因：主体的自然语言理由、信息缺口、谈判让步和跨轮记忆难以表达。当前系统把 LLM 放在“动作提议层”，把经济数值真相放在确定性引擎和复式账本中。

## 9. 成本归属与社会损失的正确口径

旧的 `who_pays_incidence` 同时混合平台补贴、商户利润、骑手收入和消费者补贴福利，不能相加为社会损失。现在报告明确拆为三层：

1. 现金与福利代理位置：回答每类主体在样本世界的现金/补贴福利方向。
2. 转移账户：消费者付款、补贴、佣金、骑手支付。它们是主体之间的转移，不自动构成社会资源损失。
3. 已识别资源成本：商户直接投入、临时用工、已记录平台运营成本、政府行政成本。

仍未识别的项目：平台私有固定/增量运营成本、门店租金资本能源、骑手时间机会成本与安全外部性、消费者等待与品质变化、交通拥堵和环境外部性。因此系统故意不报告一个“净社会损失总额”。

## 10. 现实契合度验证协议

### 10.1 数据和来源门禁

- 场景所有 `source_id/source_ids` 必须出现在来源注册表。
- 广州事实与跨城迁移先验必须分栏。
- 原始美团数据不提交、不部署。
- 参数注册表逐项写明允许和禁止的现实声称。

### 10.2 时间留出验证

美团匿名城市 8 天按时间顺序拆分：前 6 天训练，第 7 天只做超参数、神经网络 seed 与 early stopping 选择，第 8 天最终测试。不得随机打乱把同一天相邻时点泄漏到训练与测试。

协议 A 是一步日内预测：所有模型在预测一个五分钟 bin 前，都只能看到完全相同的前 24 bins（120 分钟），共评分 264 bins。第 8 天结果：

| 模型 | MAE（单/5分钟） | RMSE | sMAPE | WMAPE |
| --- | ---: | ---: | ---: | ---: |
| WHO PAYS 在线季节迁移曲线 | 13.069661 | 18.744007 | 0.110406 | 0.052033 |
| GRU | 14.327967 | 20.439406 | 0.136974 | 0.057043 |
| ExtraTrees | 14.588652 | 21.410717 | 0.111321 | 0.058081 |
| HistGradientBoosting | 16.411695 | 25.063720 | 0.118248 | 0.065339 |
| Transformer | 17.033993 | 23.170221 | 0.183029 | 0.067816 |
| MLP | 18.743895 | 30.550034 | 0.137544 | 0.074624 |
| 上一时点朴素基线 | 23.265152 | 42.394343 | 0.158388 | 0.092624 |
| Ridge 自回归 | 23.495572 | 39.725957 | 0.165628 | 0.093542 |

协议 B 是日提前预测：任何模型都看不到目标日观测，共评分 288 bins。WHO PAYS 六日均值季节曲线 MAE 15.976273，前一日 seasonal naive 为 44.309028，Fourier Ridge 为 128.798768。Fourier 结果较差也原样保留，不因不利而删除。

旧 `transformer-temporal-holdout.json` 曾给 Transformer 滚动目标日历史，却只给季节曲线固定的前两小时缩放，信息集不公平；文件留档，但所有优势文案均由上述 v2 公平协议替代。当前结果只说明在 8 天匿名城市短样本的需求任务上，稳定日内曲线表现最好。不能宣称 WHO PAYS 全系统优于 Transformer，也不能证明广州预测有效。

### 10.3 多种子、灵敏度和履约目标

`guangzhou-validation-v2` 已以 4 ticks 为最终研究基准运行 3 个 seed，并执行 12 个 OAT：出餐 2/3 ticks、活动冲击 1.0/1.7、社交转发 0.02/0.12、社交需求弹性 0/0.40、平台预算 0.5/2.0、商户成本率 38%/55%。所有 15 次运行账本均平衡。

seed 区间只传播仿真随机性；单因素范围只暴露选定结构不确定性。两者都不是后验置信区间。履约结果与匿名城市 p50/p90 对比，仅用于发现模拟明显过快或过慢。

最终 3-seed 基准：下单均值 354（333—373），完成均值 353.667（332—373），平均履约 25.017 分钟（24.276—25.716），p90 均值 41.667（40—45），补贴 149,073 分（142,025—152,655），骑手风险代理均值 0.295471，商户退出率为 0。匿名城市迁移目标为 p50 28.417、p90 48.267；基准 p50 20、p90 41.667 仍偏快，所以当前结论是“数量级可接受但仍需广州留出”，不是“已校准成功”。

OAT 显示出餐参数高度敏感：2 ticks 时平均履约 10.477、完成 398；3 ticks 时 15.627、完成 375；4 ticks 基准约 25 分钟。活动冲击 1.0→1.7 时完成单由 323 增至 371，平均履约由 23.7 增至 28.518。社交需求弹性 0→0.4 时完成单由 352 增至 371。商户成本率 38%→55% 时样本商户利润从 459,943 分降至 294,624 分。平台预算乘 0.5/2.0 的 ABM 输出完全相同，证明该宽预算区间未绑定；更低的 50k—500k 阈值只在下节的政策候选实验中测试，不把未运行的 ABM 分支说成运行过。

### 10.4 LLM 提议层与确定性守卫实测

DeepSeek v4 flash 与 MiniMax-M2.7 接收字节一致的 12 个案例：3 个冻结目标画像 × 500k/250k/100k/50k 分批准亏损预算。每个案例的候选可行性、违反项、Pareto 成员和配置分数都由生产 `PlatformPolicyEvaluator` 生成。

| 模型 | HTTP 成功 | schema 合法 | 原始选择可行 | 原始命中配置最优 | 识别全部不可行候选 | 中位延迟 | 守卫后命中 |
| --- | ---: | ---: | ---: | ---: | ---: | ---: | ---: |
| DeepSeek v4 flash | 12/12 | 12/12 | 12/12 | 12/12 | 12/12 | 4.245 秒 | 12/12 |
| MiniMax-M2.7 | 12/12 | 11/12 | 11/12 | 11/12 | 11/12 | 29.107 秒 | 12/12 |

MiniMax 在 `profit_recovery-budget-50000` 返回了无法提取完整字段的内容；生产守卫没有采用该原始输出，而是重算可行性与配置最优，得到 `CANDIDATE-NO-SUBSIDY`。DeepSeek 经现有生产代理未返回 usage，不能把 token=0 当成免费或零消耗；MiniMax 12 次记录 4,834 prompt、17,666 completion、22,500 total tokens。

这项实验支持“LLM 提议 + 确定性经济/权限守卫”比“把 LLM 当结算器”稳健，不支持 DeepSeek 或 WHO PAYS 的通用智能最优。若换提示、候选、语言、服务版本或开放式谈判，结果可能变化。

### 10.5 升级为现实政策证据的最低条件

必须新增：

1. 广州订单级需求和履约留出集。
2. 广州茶饮门店队列、排班、人工和单位成本样本。
3. 合法获得的平台城市活动预算与真实分摊。
4. 匿名广州骑手工时、休息、收入和安全样本。
5. 广州本地社交/投诉聚合观测，而不是个人关系抓取。
6. 至少一座外部城市的迁移验证。

在满足前，报告等级保持“机制研究”，不得提升为“广州预测”或“政策效果认证”。

### 10.6 官网三轮端到端验收（2026-08-13）

官网 `https://whopays.classby.cn/` 已用真实 LLM + 统一引擎跑通一条三轮链，验收 ID 如下：

```text
simulationId = official-guangzhou-llm-e2e-20260813-1315
roundtableRunId = ROUND-MSR2B9W4
scenarioVersion = guangzhou-liqiu@1.0.0-research
actorConfigVersion = actor-config@complete-three-platform-v1
seed = 20260812
```

| 阶段 | LLM/政策写入 | 推进后回执 | policy 与 baseline 的可观测差异 |
| --- | --- | --- | --- |
| opening | 2 位主体真实调用 `deepseek-v4-flash`；商务监测与平台券动作通过守卫；政策包 `policy:ROUND-MSR2B9W4:opening` applied | T+24，policy `w412`；117 单、完成 79、平均履约 23.861 分钟 | 同时点 baseline 订单/履约相同；说明动作的现金/履约效应尚未充分展开 |
| rebuttal | 第二轮读取 T+24 的完成率、骑手拒单、疲劳、投诉等指标；两个主体都点名回应 opening turn；政策包 `...:rebuttal` applied | T+48，policy `w759`；183 单、完成 172、平均履约 28.634 分钟 | 完成单 -5、补贴 +12,795 分、平台利润 -11,270 分、消费者福利 +15,100 分、骑手风险 -0.011868 |
| closing | 第三轮读取 T+48 指标并形成条件性方案；2 人联盟因支持度 0.60/0.70 未达到共同 0.67 而保持 `proposed`，没有伪装成 accepted；closing 政策包 applied | T+72，policy `w1001`；217 单、完成 215、平均履约 27.977 分钟 | 完成单 +2、补贴 +24,140 分、平台利润 -24,058 分、商户利润 -273 分、骑手收入 +1,200 分、消费者福利 +28,400 分、骑手风险 -0.016231 |

T+72 的 `stateHash=2b78074d9269730e028866a734643a49e8c8c5dad8f16ccacba16ae20511df33`，再次读取官网 session 与引擎 summary 完全一致。该单次结果只证明“配置—LLM 会商—白名单动作—ABM—policy/baseline—版本/哈希”链路可运行；它不是政策有效性或广州现实效果证据。

本次验收还暴露并修复了两项生产问题：一是共享虚拟环境的 editable package 一度仍指向旧 P0 release，导致默认请求返回上海时期的 216 ticks；发布流程现已重新绑定广州 release。二是模型偶尔返回非严格 JSON；圆桌和战略窗口现优先请求 `json_object`，单主体失败则落为 `uncertainty/hold`，不写世界且不阻断同轮其他主体。

## 11. 预测模型、LLM 与模拟器对照

### 11.1 预测器对照

Transformer、GRU、树模型与季节模型对比的是单一、严格定义的时序预测任务。深度模型擅长从足够长的序列学习非线性模式；当前 8 天数据太短，结果对 seed 和容量敏感。WHO PAYS 的优势不在取代某个预测器，而在把可替换的需求预测作为输入模块后，继续解释补贴、队列、骑手、商户、政府、账本和政策分支之间的传导。未来广州订单数据足够时，应允许 GRU/Transformer/树模型通过同一接口替换季节模块。

### 11.2 MiroFish

对官方仓库固定 revision `b5b53acc57189a4a42e44a23e149dc655c98fe82` 的代码/文档审计显示，其典型流程是 GraphRAG 种子材料、persona 生成、OASIS 双社交平台模拟、ReportAgent。DeepSeek v4 flash 可以通过 OpenAI 兼容配置作为 `LLM_API_KEY`；但 MiroFish 的 Config、图构建、实体读取、人设生成和 simulation API 都要求独立的 `ZEP_API_KEY`。MiniMax Key 是模型服务凭证，不能代替 Zep Cloud 图记忆。当前唯一缺失项是 `ZEP_API_KEY`，状态为 `not_run_missing_zep_api_key`，没有伪造数值成绩。

不能把“未运行”写成 WHO PAYS 胜出。公平实验还需同一广州证据包、相同主体、相同三轮、相同 12 小时 horizon、相同 seed，并让 MiroFish 导出经济流、硬约束、事件和最终状态。

### 11.3 AgentSociety 2、Mesa 与 GAMA

- AgentSociety 2 更适合通用 LLM 社会研究、较大人群和城市环境；要比较“谁在买单”，仍需实现五类主体权限、复式成本归属和确定性政策守卫。
- Mesa 是成熟的 Python ABM 基础组件。WHO PAYS 本身依赖 Mesa，但账本、版本、五类主体、圆桌与政策守卫是本项目代码，不能把它们算作 Mesa 默认能力。
- GAMA 更适合 GIS 路网、空间 ABM、批量虚拟实验、参数探索与校准。若未来取得合法广州路网与配送轨迹，它是最值得加入的空间挑战者；当前没有在同一证据包上运行，不能给数值名次。

能力协议只用 `executed / verified_source / not_native / blocked / unknown`，不把预测 MAE、LLM 延迟、GIS、人口规模和账本完整性混成一个主观总分。

### 11.4 WHO PAYS 的真实优势与短板

优势：

- 同一个 `simulationId/worldVersion` 串起配置、对话、ABM、账本和报告。
- LLM 只能提出白名单动作；经济结果由确定性 handler 计算。
- policy/baseline 同种子分支、复式账本、幂等回执和状态哈希可审计。
- 能明确区分主体间现金转移和社会资源成本。
- 适合回答“政策如何改变谁承担成本”这类机制问题。

因此允许的表述是：“在本次已审计系统中，WHO PAYS 是对外卖成本归属、政策守卫和回放审计这一窄任务的最强已执行适配。”禁止表述是：“WHO PAYS 在预测、社会模拟、GIS、大规模仿真和所有城市任务上普遍最好。”MiroFish 的开放式社会叙事、AgentSociety 的规模、GAMA 的 GIS 都可能在各自任务上更强。

短板：

- 广州微观订单、门店、骑手和平台预算数据仍缺失。
- 社交图和主体人数是合成微观样本，不是人口镜像。
- 事件级写入使用全世界深拷贝回滚，随事件增长显著变慢；当前适合中小规模研究，不适合声称千人实时仿真。
- 语言模型服务失败时只能安全回退为 hold；这保持可审计性，但降低行为丰富度。

## 12. 运行、回放与测试

构建广州场景：

```bash
uv run python scripts/calibrate_public_data.py
uv run python scripts/build_guangzhou_scenario.py
```

运行单次：

```bash
uv run who-pays run \
  --scenario scenarios/delivery-war-guangzhou-liqiu-v1.json \
  --seed 20260812 \
  --simulation-id gz-baseline-20260813
```

验证：

```bash
uv run pytest -q
uv run python scripts/run_guangzhou_validation.py
uv run python scripts/audit_parameter_coverage.py
uv run python scripts/calibrate_guangzhou_traffic.py
uv run --with torch --with scikit-learn python benchmarks/forecast_model_suite.py
uv run python benchmarks/llm_decision_guard_benchmark.py
python ../agent-skills/who-pays-validate-models/scripts/validate.py \
  --evidence ../agent-skills/who-pays-validate-models/assets/benchmark-evidence.json
```

每次报告至少保留：场景版本、参数状态、seed、simulationId、branchId、worldVersion、stateHash、事件数、账本交易数、账本平衡、指标、来源边界和未识别成本。

## 13. 冻结页面等待接入的字段

Data Reports 与 Workbench 改版后需要接入：

- 广州 city pack 和 `parameter-register` 状态。
- “ABM 物理时间 144×5 分钟”与“政策叙事三天/三年”的双时钟。
- 三轮的 T+24/T+48/T+72 阶段回执。
- baseline/policy 分支矩阵、seed 集合和敏感性网格。
- 品牌—门店、district、社交网络状态及其“合成/观测”标签。
- 现金转移、资源成本和未识别外部性的分栏。
- 完整预测模型时间留出、DeepSeek/MiniMax 提议与守卫结果、模拟器能力协议及 MiroFish 的 Zep 阻塞原因。
- 数据许可、原始数据不部署声明、现实外推门禁。

在页面字段未完成前，上述值可以不展示，但不能用旧上海标签、P0 演示金额或“真实预测”文案填补空白。

## 14. 主要公开链接

- 广州统计年鉴 2025：<https://tjj.gz.gov.cn/datav/admin/home/www_nj/2025/index.html>
- 广州人口密度目录：<https://tjj.gz.gov.cn/datav/admin/home/www_nj/2025/directory/01.html>
- 广州收入目录：<https://tjj.gz.gov.cn/datav/admin/home/www_nj/2025/directory/08.html>
- 广州餐饮目录：<https://tjj.gz.gov.cn/datav/admin/home/www_nj/2025/directory/14.html>
- 广州最低工资：<https://rsj.gz.gov.cn/zzzq/tzgg/content/post_10632184.html>
- 广州市人民政府工作规则：<https://www.gz.gov.cn/zwgk/fggw/szfwj/content/post_9297894.html>
- 广州市市场监督管理局职责：<https://scjgj.gz.gov.cn/zwgk/zfxxgkml/zfxxgkml/zfxxgkml/zzjg/jgzn/content/post_10613035.html>
- 广州市商务局职责：<https://sw.gz.gov.cn/xxgk/jgzn/content/post_9733108.html>
- 广州市人力资源和社会保障局职责：<https://rsj.gz.gov.cn/zwgk/zfxxgkml4/zzjg/jgzn/content/post_10565741.html>
- 广州市交通运输局职责：<https://jtj.gz.gov.cn/gkmlpt/content/10/10607/post_10607068.html>
- 广州市财政局职责：<https://czj.gz.gov.cn/gkmlpt/content/10/10837/post_10837854.html>
- 美团研究挑战数据：<https://github.com/meituan/Meituan-INFORMS-TSL-Research-Challenge>
- CHAGEE 2025 Form 20-F：<https://www.sec.gov/Archives/edgar/data/2013649/000110465926050766/cha-20251231x20f.htm>
- 美团 2025 年报：<https://www1.hkexnews.hk/listedco/listconews/sehk/2026/0424/2026042400179.pdf>
- ABM 异质性与网络结构：<https://pubsonline.informs.org/doi/10.1287/mnsc.1070.0787>
- MiroFish 官方仓库：<https://github.com/666ghj/MiroFish>
- MiniMax 模型调用文档：<https://platform.minimaxi.com/docs/guides/text-generation>
- 广州交通速度数据：<https://zenodo.org/records/1205229>
- 广州 2026 年 4 月交通月报：<https://jtj.gz.gov.cn/jtzt/jtsj/jtysyb/content/post_10838424.html>
- SNAP Higgs 社交网络数据：<https://snap.stanford.edu/data/higgs-twitter.html>
- AgentSociety 2 文档：<https://agentsociety2.readthedocs.io/en/latest/>
- Mesa 文档：<https://mesa.readthedocs.io/stable/>
- GAMA 文档：<https://gama-platform.org/wiki/next/Home>
- 广州 SkillHub 主图来源：<https://commons.wikimedia.org/wiki/File:GuangzhouSkyline2020.jpg>
