文章

城市与人类系统仿真研究综述

从机制模型、时空预测和生成模型,到城市基础模型与大语言模型智能体,梳理城市及人类行为仿真的研究脉络、论文图谱与开放问题。

城市与人类系统仿真研究综述
Literature Survey · 2010–2026

本综述梳理城市系统仿真与人类行为模拟两条研究线的演进,重点覆盖 NeurIPS、ICLR、ICML、AAAI、IJCAI、KDD、WWW、ICDE、CIKM、SIGSPATIAL、AAMAS 等计算机会议 2018 至 2026 年的工作,并向上追溯至 2010 年前后的机制模型阶段。全文按研究脉络组织,不按论文清单罗列;每条主线给出问题的变化、方法的替换和转折点的位置。所有条目标注发表出处的核实状态。

收录论文条目
已核实正式发表
仍为预印本
涉及发表出处
2010–2026
时间跨度

总览:这个领域到底在研究什么

“城市/人类仿真”在计算机会议上不是一个单一议题,而是四类目标不同的工作被同一个词覆盖。分清这四类是读懂全部文献的前提。

第一类是观测预测:给定历史观测预测未来观测,代表是交通流预测的时空图神经网络谱系。城市在这里只是数据源,不是被建模的对象。第二类是数据合成:生成不存在但统计上可信的个体轨迹或群体流量,动机来自隐私管制与数据稀缺,代表是从生成对抗网络到扩散模型的轨迹生成线。第三类是机制仿真:显式建模个体决策规则并让其交互,观察系统层面的涌现,代表是基于智能体的建模(ABM)、强化学习交通信号控制、流行病与经济仿真。第四类是行为模拟:用大语言模型扮演具体的人,复现其态度、选择与社会互动,代表是生成式智能体一脉。

2023 年以前,这四类基本各自独立发展,共享的只有数据集。2023 年之后发生了两件事:其一,第一类和第二类被”城市基础模型”合并——同一个预训练模型同时做预测、补全和生成;其二,第三类和第四类被大语言模型智能体合并——LLM 取代了 ABM 中的手写决策规则。本综述的核心判断是:真正的范式转折不在”用了大模型”,而在建模目标从拟合分布转向模拟决策过程,以及评价标准从预测误差转向跨城市泛化与行为有效性。

发表出处标注约定
该领域有一个必须正视的结构性事实:多篇高影响力工作(MOSS、AgentSociety、OASIS、LLM-Mob、S³、SocioVerse、千人生成式智能体等)至今仍是 arXiv 预印本,未经同行评议。大量中文二手材料把它们写成顶会论文,这是不准确的。本综述对每条目标注三种状态:已核实 指已在官方会议录、期刊页面、OpenReview venue 字段或 arXiv 元数据的 Comments/Journal-ref 中直接确认;预印本 指检索后未发现任何正式收录记录;待核实 指仅有第三方整理列表、投稿模板或作者主页自述作为依据。

分类体系:建模对象 × 建模范式

横轴是被模拟的对象尺度,纵轴是产生行为的机制。同一个应用问题在不同格子里会得到完全不同的方法论,也会被送到不同的会议。

个体(单人 / 单车 / 单智能体)群体(区域 / 路网 / 社群)系统(城市 / 社会 / 经济体)
机制规则
手写方程或规则
EPR 探索-回访模型、社会力模型、跟驰模型物理与交通工程刊物为主,CS 顶会几乎缺席重力模型、辐射模型、Max-Pressure 信号控制被 CS 论文当作先验与基线复用SIR 类流行病 ABM、宏观经济 ABM、Schelling 隔离模型经典社会科学仿真,2023 后被 LLM 改写
判别式学习
观测到观测
下一位置预测、出行方式选择KDD / WWW / SIGIR时空图神经网络交通预测(DCRNN、STGCN、Graph WaveNet)ICLR / IJCAI / AAAI,2018–2022 主战场城市区域画像、社会经济指标预测(UrbanCLIP、UrbanVLP)WWW / AAAI
生成式学习
拟合并采样分布
轨迹生成:MoveSim → TS-TrajGen → DiffTraj → ControlTrajKDD / NeurIPS / AAAI,2020–2025OD 流量生成、人群仿真、三维城市生成KDD / SIGSPATIAL,正式发表通道偏少城市时空基础模型:UniST、UrbanDiT、OpenCityKDD / NeurIPS,2024 后主线
决策优化
与仿真环境交互
单路口信控、单车调度KDD 2018 起路网级多智能体 RL(CoLight、MPLight)、订单派发KDD / CIKM / AAAI税收政策设计(AI Economist)、城市空间规划 RL、疫情干预排程Science Advances / Nature Comp Sci / IJCAI
语言模型智能体
模拟决策过程
生成式智能体、访谈锚定的个体孪生、LLM 出行日程生成UIST / NeurIPS / NAACL社交网络与推荐生态模拟(OASIS、Agent4Rec、AgentCF)SIGIR / WWW,大规模平台多为预印本城市社会仿真(AgentSociety)、宏观经济(EconAgent)、参与式规划ACL / KDD / WWW,验证方法尚未统一
读表提示
从上往下,模型的可解释性与可标定性递减,表达能力与工程成本递增。2023 年之后的大量工作实际上是在做"跨行融合":把第一行的机制约束注入第三、五行(物理引导人群仿真、计划行为理论驱动的轨迹生成、可微 ABM),或者把第五行当作第四行的策略生成器(Intelli-Planner 用 LLM 决定建什么、RL 决定建在哪)。纯第五行的方案在 2025 年后已被系统性质疑,理由见第 07 节。

研究脉络:五个阶段

阶段划分依据是”主流论文在回答什么问题”,而不是技术名词的出现时间。每个阶段末尾给出把它推向下一阶段的具体工作。

2010–2017
机制模型阶段主战场不在 CS 会议

核心问题是”能否用少量参数解释人类移动的统计规律”。EPR 模型用探索与优先回访两个机制解释个体轨迹的标度律,辐射模型用机会介入机制替代重力模型解释 OD 流量,TimeGeo 把这套机制接到手机信令数据上,实现无需出行调查的城市级出行生成。这一阶段的产出发表在 Nature Physics、Nature、PNAS,而非 NeurIPS 或 KDD。

它对后续的决定性影响不在方法,而在评价体系:回转半径分布、位移分布、访问频次幂律、探索率衰减,至今仍是所有深度生成模型论文必须报告的指标。这套指标在 2025 年被证明存在根本缺陷(见 07 节)。

推向下一阶段:Deep Gravity(Nature Communications 2021)用神经网络替换重力模型的函数形式,说明机制模型的参数化部分可以被学习组件替代。
2018–2020
预测优先阶段仿真是强化学习的基础设施

问题从”解释”转向”预测得更准”。DCRNN(ICLR 2018)与 STGCN(IJCAI 2018)几乎同时把图神经网络引入交通预测,ASTGCN(AAAI 2019)加入时空注意力,Graph WaveNet(IJCAI 2019)提出自适应邻接矩阵,说明图结构本身可以被学出来。这四篇确立了时空图神经网络范式,PEMS 与 METR-LA 成为标准评测集。

与此并行的是强化学习交通信号控制:IntelliLight(KDD 2018)→ PressLight(KDD 2019)→ CoLight(CIKM 2019)→ MPLight(AAAI 2020),从单路口推到上千路口协同。这一支才真正需要仿真器,因为策略必须与环境交互,CityFlow(WWW 2019)因此出现。

本阶段的结构性变化:仿真从"研究对象"变成"训练基础设施"。同时埋下一个至今未解的问题——这条线所有结果都在 CityFlow / SUMO 上取得,主会论文中没有任何路口实测报告。
2020–2023
生成式转向GAN → 点过程 → 扩散

问题从”预测下一步”变成”合成整条轨迹”。三重驱动力:隐私管制使真实轨迹越来越难获取;疫情期间需要反事实移动模拟;生成模型在其他模态上成熟。MoveSim(KDD 2020)把 EPR 式先验嵌入 GAN,是第一篇正式工作;TS-TrajGen(AAAI 2023)用两阶段 GAN 加路网搜索解决轨迹连续性;DSTPP(KDD 2023)用扩散建模时空点过程。

DiffTraj(NeurIPS 2023)是明确的转折点:首次把去噪扩散概率模型直接用于连续 GPS 轨迹合成,保真度大幅超越 GAN 与 VAE 基线。此后 ControlTraj(KDD 2024)、Diff-RNTraj(TKDE 2024)、Seed(WWW 2025)都在扩散框架内做可控性与路网约束的加法。

同期暴露的问题:LibCity(SIGSPATIAL 2021)与 LibSignal(MLJ 2023)分别揭示了时空预测与信控的可复现性危机——换个仿真器结论就变;DLinear(AAAI 2023)与 SimST(2023)用极简基线打平复杂模型。
2023–2025
基础模型化与生成式智能体并行爆发

城市侧:问题从”为每个城市训一个模型”变成”训一个模型服务所有城市”。GPT-ST(NeurIPS 2023)做生成式时空预训练;2024 年 KDD 同时出现 UniST(prompt 驱动的原生时空通用模型)与 UrbanGPT(把时空编码器对齐进 LLM),两条路线的分歧在此刻确立;《Urban Foundation Models: A Survey》(KDD 2024)完成范式命名。到 2025 年,UrbanDiT(NeurIPS 2025)用扩散 Transformer 统一预测、补全、生成多任务,代表原生路线的收敛形态。

人类侧:Generative Agents(UIST 2023 最佳论文)用记忆流、反思、规划三模块给出可复制的架构模板,随后在社交网络(S³)、宏观经济(EconAgent, ACL 2024)、市场竞争(CompeteAI, ICML 2024)、推荐系统(Agent4Rec, SIGIR 2024)、公地治理(GovSim, NeurIPS 2024)、规范涌现(IJCAI 2024)横向铺开。SOTOPIA(ICLR 2024)第一次把开放式社会互动变成可评分的基准。

两条线的交汇点:LLMob(NeurIPS 2024)用 LLM 智能体的动机推理生成个人日程轨迹,AgentMove(NAACL 2025)用智能体框架做零样本位置预测——建模目标从拟合分布转向模拟决策过程,可解释性第一次成为一等目标。
2025–2026
验证危机与方法论收敛当前所处阶段

规模竞赛先于同行评议:OASIS 宣称百万智能体、AgentSociety 达到万级智能体与五百万次交互、SocioVerse 挂靠千万真实用户池——这几项至今均为预印本。与此同时批判性证据已经足够扎实:LLM 无法复现问卷响应偏差(TACL 2024)、无法复现变量间相关结构(Political Analysis 2024)、无法自发产生人类式极化(NAACL Findings 2024)、对弱势群体的画像系统性同质化(CoMPosT, EMNLP 2023)、在协调博弈中显著弱于人类(Nature Human Behaviour 2025)。

ICML 连续两届收录针锋相对的立场论文:2025 年 Anthis 等主张障碍可解,2026 年 Puelma Touzel 等直指”验证鸿沟”——评估稀疏、不一致、跨学科不共享,未经验证的系统正被过早用于政策场景。FAccT 2026 的机制可信度分级把”能复现现象”与”机制可解释”正式分离。城市侧的对应工作是 SIGSPATIAL 2026 用巴黎与上海真实数据检验 AgentSociety 与 CitySim,结论是语义活动分布尚可、行程长度分布与 OD 流系统性失真。

方法论收敛的方向:"LLM 负责语义与知识、专用模型负责数值与物理"成为默认分工(TrajAgent、Intelli-Planner、UrbanDS),可微 ABM 与模拟推断补齐标定环节,评测从分布匹配下沉到下游任务效用与个体级一致性。

五条主线的内部演进

上一节按时间横切,本节按主题纵切。每条主线给出阶段划分、方法替换的具体路径,以及那篇改变了后续研究提问方式的工作。

主线 A · 城市系统仿真:移动性、轨迹与交通

KDD / NeurIPS / AAAI / ICLR / IJCAI / WWW / CIKM / SIGSPATIAL|33 条

这是唯一一条完整跨越 2010 到 2026 的主线,也是唯一一条评价指标被上游学科(复杂系统物理)设定的主线。它的内在张力在于:机制模型给出了可解释性和指标体系,深度模型给出了拟合能力,两者的融合始终没有完成。

2010–2017
机制模型定义指标EPR、辐射模型、TimeGeo。回转半径、位移分布、访问频次成为事实标准指标,此后十五年未变。
2018–2020
时空图神经网络接管预测任务DCRNN、STGCN、ASTGCN、Graph WaveNet。任务是观测到观测,城市不被建模。同期 RL 信控催生 CityFlow 等仿真器。
2020–2023
生成模型接管合成任务MoveSim(GAN)→ TS-TrajGen(GAN+路网搜索)→ DSTPP(扩散点过程)→ DiffTraj(扩散,转折点)。
2023–2025
可控性与路网约束成为主要增量ControlTraj 引入路网拓扑编码器,Diff-RNTraj 在"路段 ID + 连续偏移"混合空间上扩散,Seed 缝合序列模型与扩散模型。
2024–2026
基础模型化,以及 LLM 智能体的第二次范式跃迁UniST → UniFlow → UrbanDiT 收敛到扩散 Transformer 架构;LLMob、AgentMove、TrajAgent 转向模拟决策过程。
转折点判定:DiffTraj(NeurIPS 2023)改变了技术路线,MIRAGE(KDD 2025)改变了提问方式——它指出分布统计量相同的数据在结构上可以截然不同,因此分布匹配既不充分也具误导性。
结构性短板:学习型跟驰模型与微观仿真器自动标定这一支基本不在 CS 顶会,成果集中在 Transportation Research Part C、IEEE T-ITS、ACM TOMACS。这意味着 CS 侧城市仿真的底层物理并不扎实。

主线 B · LLM 社会与人类行为模拟

UIST / NeurIPS / ICLR / ICML / ACL / AAAI / IJCAI / SIGIR / AAMAS|39 条

这条线只有四年历史,但完成了完整的乐观—扩张—质疑循环。它有两个独立起源:HCI 侧的 Social Simulacra(UIST 2022)把 LLM 当作合成人群生成器;社会科学与机器学习侧的 Out of One, Many 与 Turing Experiments(ICML 2023)把 LLM 当作可条件化的被试替代。两者共享同一前提:语言模型压缩了足够多的人类行为分布,因此可以被采样出人。

2022–2023H1
可行性证明成功标准是"能复现某个经典发现"(最后通牒博弈、Milgram 服从、群体智慧)。方法上以提示工程加人口统计学画像为主。
2023H2–2024
架构化与场景铺开Generative Agents 的记忆流—反思—规划成为事实标准;衍生方向包括加入需求与情绪(Humanoid Agents)、降低成本 10–100 倍(Lyfe Agents)、改造记忆机制(MemoryBank)、改造训练范式(Character-LLM)。
2024–2025
规模竞赛与真人锚定同时加速规模侧:OASIS 百万级、AgentSociety 万级、AAMAS 2025 的行为原型方法推到百万级。锚定侧:千人深度访谈构建个体智能体,在留出题上达到人类两周重测一致性的 86%;Twin-2K-500 提供公开评测底座。
2025–2026
立场之争制度化ICML 2025 与 ICML 2026 连续收录正反两篇立场论文;FAccT 2026 提出机制可信度四级量表,把生成充分性与机制解释性分离。
转折点判定:架构上是 Generative Agents(UIST 2023);方法论上是千人访谈锚定工作——它把评价标尺从"群体均值是否对"抬高到"个体级重测一致性",代价是可扩展性极高。
当前三个焦点分歧:(1)保真度应当用群体均值、分布形状、变量间相关结构还是个体一致性来度量;(2)百万智能体带来的是新涌现还是同一模型偏置的百万倍放大;(3)模拟应当被定位为假设生成器、政策沙盒,还是人类被试的替代。

主线 C · LLM × 城市:城市基础模型与城市智能体

KDD / WWW / NeurIPS / ICLR / AAAI / ICDE / EMNLP / SIGSPATIAL|43 条

这条线是 A 与 B 的交集,也是 2024 年以来产出最密集、团队集中度最高的方向。它的问题演进极为清晰:LLM 知不知道空间 → 能不能做城市任务 → 能不能当城市世界模型 → 该在系统里承担什么角色。

2023
能力探针地理知识探针(GPT4GEO、SIGSPATIAL 2023 系列)与零训练纯提示的任务可行性验证(LLM-Mob 是引爆点,至今仍是预印本)。同期时序侧输入方法论:One Fits All、LLMTime、Time-LLM。
2024
范式确立与顶会收编KDD 2024 同时出现 UrbanGPT 与 UniST,两条路线分歧确立;GeoLLM(ICLR 2024)证明地理先验有实用价值;UrbanKGent(NeurIPS 2024 主会)把城市知识图谱构建智能体化;UrbanLLM(EMNLP 2024 Findings)确立"LLM 作任务调度器而非求解器"的定位。
2025
评测与基座双重制度化CityGPT 与 CityBench(均 KDD 2025)成对出现,13 城 8 类任务 30 个模型的评测给出诚实结论:LLM 在城市常识任务上可用,在数值与专业推理任务上系统性失败。仿真侧出现规模跃迁与户外具身赛道(EmbodiedCity、CityEQA)。
2026
落地化与物理约束化UrbanDS 在武汉真实城市运营中部署;Intelli-Planner(WWW 2026)明确用 LLM 决定建什么、RL 决定建在哪;Information Fusion 2026 的物理信息 AI 综述主张给城市模型加物理约束。
关键反证:NeurIPS 2024 Spotlight 的《Are Language Models Actually Useful for Time Series Forecasting?》用消融实验显示,移除 LLM 组件或替换为简单注意力层不降反升。其余波直接体现在 2025 年后的架构选择:TrajAgent 采用大模型调度加小模型数值建模,OpenCity 回到原生时空基础模型。
判断:"LLM 作预测器"这一角色已基本被证伪;"LLM 作知识源、调度器、仿真主体"三个角色被保留。综述若仍按"LLM 的五种角色"平铺会失真。

主线 D · 方法论、标定与评测

NeurIPS D&B / ICML / AAMAS / TACL / PoPETs / FAccT / KDD|40 条

这条线不生产模型,只生产判断标准。它的重要性在 2024 年之后急剧上升,原因是前三条线的增速已经超出了验证能力。

2018–2022
分布匹配即真理移动性沿用物理学传统用 JSD/KL,时空预测用 MAE/RMSE。推荐系统领域 2019 年已发出复现性警告,城市计算社区未接受。
2022–2025
基准本身成为被审查对象三条独立证据线:数据泄漏(下一位置预测基准中 43–72% 测试轨迹与训练集重叠,模型在真正新颖轨迹上准确率不足 5%);基线不公(DLinear、SimST、BasicTS 说明大量结构增益在统一协议下消失);规模不足(LargeST 把节点数从 300 提到 8600)。MIRAGE(KDD 2025)给出总结性判词。
2020–2026
标定从手调走向可推断,但可微化不是免费的模拟推断(PNAS 2020)→ 经济 ABM 的神经后验估计基准化(JEDC 2024)→ GradABM(AAMAS 2023)让百万体 ABM 端到端可微。同一批作者随即指出三重障碍:Gumbel-Softmax 梯度有偏且高方差、反向自动微分显存随规模爆炸、长程蒙特卡洛梯度方差不可用。
2023–2026
LLM 模拟的效度之争从"像不像"转向"能不能推因果"最致命的一击来自因果推断视角:提示中改变一个处理变量往往同时隐含改变了其他未观测变量,导致模拟出的处理效应在原理上被混杂——这一点不能靠更大模型或更好提示解决。
2025–2026 新增的独立评测维度:方差坍缩。早期评价只问均值是否对,现在必须同时问离散度是否对。几何诊断显示保真度最高的模型产出最坍缩的画像;非西方人群数据上测得熵从 1.46 降到 0.77、85% 单元坍缩。失效模式不是随机噪声,而是朝人口刻板印象与模态默认值的定向收缩。

主线 E · 应用与政策落地

KDD / WWW / AAAI / IJCAI / ICLR / Science 系列|29 条

这条线最值得关注的不是有多少论文,而是哪些真的部署了。把”论文声称的政策价值”与”文献中可查证的部署记录”分开列,是本综述认为最有解释力的组织方式。

2018–2019
平台内部的可运营仿真先落地最早跑通"仿真到部署"闭环的是互联网平台而非城市政府:滴滴订单派发、Virtual-Taobao、RecSim。共同点是环境归研究者所有,可做在线 A/B,反馈以天计。
2020–2022
疫情把仿真做政策推成显学《Nature》2021 的移动性网络模型证明手机数据加机制模型可以直接回答"限流到几成"这类具体问题。随后分成预测(EINNs)与干预优化(EpiPolicy、IJCAI 2023 多干预 RL)两路。经济沙盒同期成型:AI Economist 优化研究者设定的福利标量,Democratic AI 把人类投票偏好本身作为优化目标——这一价值观分歧至今未收敛。
2023–2024
可微化与生成式两条技术路线同时打开天花板GradABM 把标定从统计反演变成梯度下降,随后在 Vaccine 期刊产出区域疫苗策略证据;城市规划从 RL 布局(Nature Comp Sci 2023)转向 LLM 参与式规划。
2025–2026
从"能不能模拟"转向"能不能在部署前审计"ICLR 2023 的曝光博弈提出预部署审计;KDD 2024 的创作者福利干预真的上线跑了三周;PolicySim(WWW 2026)把平台治理做成可优化的沙盒。
研究与落地之间的三条断层:(1)目标函数断层——论文优化通行时间与基尼系数,机构考核安全、法律责任、审计可追溯性;(2)验证断层——平台侧能做 A/B,城市与公共卫生侧结构上做不了随机对照,于是"优于人类专家"只能在仿真内自证;(3)收益量级断层——真部署的收益是 0.5%–2%(滴滴在 20 余城的公开报告),论文里常见 20%–50%,差距来自仿真省略的约束、异质性与对抗性适应。
一条可操作的经验规律:成功跨过断层的案例(洪水预警、地震预警、Green Light 信号配时建议)有共同结构——输出是信息而非管制,误报成本低,且不接管决策回路。管制型输出至今滞留在论文里。

计量视图

基于本综述收录条目的统计。样本由人工检索构建,不是该领域的完备普查,因此绝对数量没有意义,分布形状与年度变化才有参考价值。

条目的年度分布(按主线堆叠)
纵轴为本综述收录条目数。2024 年之后 LLM 相关主线的占比变化是主要观察点。
发表出处分布(前 16)
含会议、期刊与预印本。arXiv 条目数量本身即为一项结论,见 07 节趋势 08。
出处核实状态
该领域大量高影响力工作未经同行评议,这不是检索遗漏而是领域现状。
主线规模
按本综述的主线归属统计,交叉工作按主要贡献归入单一主线。

论文库

可按主线、出处类型、年份区间与关键词筛选。点击表头排序。每条给出发表出处的核实状态;标题链接指向原文。

年份出处论文与核心贡献主线

以下十条是从上述脉络中提炼的判断,每条都可以被具体工作证伪或支持,不是泛泛的展望。

开放问题

按可操作性排序:越靠前越可能在两年内被解决,越靠后越接近学科层面的困难。

1. 基准的空间与时间泄漏仍是默认设置
随机划分、测试与训练轨迹重叠、单城评测三者叠加,使跨城市与跨时段泛化——仿真最核心的能力——基本未被真正测量。已有工作证明采用基于地块的空间划分后泛化性能显著下降。这是纯工程问题,可以立即修正。
2. 协议敏感性未被当作误差来源报告
智能体的调度顺序、交互协议、初始信息先验对结果的影响目前几乎从不做消融。已有测量显示 LLM 决策与目标策略之间的分布距离可达 0.212,说明"模拟结果"中有相当比例来自实现细节而非模型行为。
3. 生成式移动性的隐私评测近乎空白
扩散与 VAE 类轨迹生成工作此前无人做成员推断攻击;且在差分隐私约束下最优的架构与无约束下不一致(无约束时扩散最优,约束下 GAN 反而更好),意味着现有的隐私—效用前沿曲线大多不可信。
4. 没有公认的多层次保真度定义
个体级一致性、分布级距离、机制级可解释性、任务级效用四套标准互相不蕴含,经验上常反向(保真度高则多样性坍缩)。在统一之前,跨论文的"更真实"比较没有意义。
5. 规模、保真度与成本的三元权衡缺乏统一坐标
行为原型方法是目前唯一把该权衡量化的尝试,但缺少跨系统可比的报告规范,例如"每智能体每步 token 成本对行为多样性"这样的双轴指标。
6. 城市仿真的底层物理不够扎实
跟驰模型、微观仿真器自动标定、行人动力学这些决定仿真下限的环节,成果集中在交通工程期刊,与 CS 主线交叉有限。CS 侧的城市仿真在上层做了大量工作,底座却是借来的。
7. 因果有效性缺乏可行的检验协议
提示混杂问题目前无广泛采纳的解法;现有的"与真实实验结论一致"属于事后表面效度,无法排除提示泄漏与训练数据污染——已有工作明确观测到记忆污染导致的子群体结论失真。
8. 政策场景的验证在结构上不可能做随机对照
这是学科层面的困难,不是方法缺陷。可行的替代是分层验证:探索性用途接受启发式验证,确证性用途要求统计校准;同时把仿真的输出限定为信息与假设,而非直接的管制建议。

团队图谱

了解这些团队的分工,比逐篇读论文更快建立领域地图。

清华大学 FIB-LAB(李勇、冯捷、高晨、徐丰力)
覆盖最全的一家,从仿真引擎到智能体社会
主线 A/B/C 全覆盖。轨迹生成(MoveSim、DSTPP)→ 基础模型(UniST、UniFlow、UrbanDiT)→ 城市认知(CityGPT、CityBench)→ 仿真引擎(Mirage、MOSS)→ 智能体社会(UGI、AgentSociety、EconAgent)→ 规划(Nature Comp Sci 2023 的 RL 空间规划)。特点是系统与平台产出多,其中相当一部分停留在预印本。
香港科技大学(广州)usail(刘浩、熊辉)
城市基础模型的命名者与知识图谱线
《Urban Foundation Models: A Survey》(KDD 2024)及其配套 tutorial 提出了被引用最广的数据中心六分类法;UUKG(NeurIPS 2023 D&B)与 UrbanKGent(NeurIPS 2024)构成城市知识图谱线;LLMLight(KDD 2025)是 LLM 信控的代表。
香港大学 HKUDS(黄超)
LLM 与时空数据的对齐路线
GPT-ST(NeurIPS 2023)、UrbanGPT(KDD 2024)、OpenCity(TIST 2025)以及《Urban Computing in the Era of LLMs》综述。特点是坚持"LLM 骨干加时空编码器对齐"这一路线,与 FIB-LAB 的原生时空模型路线形成对照。
香港科技大学(广州)CityMind(梁宇轩)
多模态城市表征与时空基础模型综述
UrbanCLIP(WWW 2024)、UrbanVLP(AAAI 2025)确立了"卫星与街景图文对比预训练做区域画像"这一支;LargeST(NeurIPS 2023 D&B)与 KDD 2024/2025 连续两届的基础模型 tutorial 是该团队在评测与综述侧的贡献。
斯坦福 HCI(Joon Sung Park、Michael Bernstein)
生成式智能体范式的定义者
Social Simulacra(UIST 2022)→ Generative Agents(UIST 2023 最佳论文)→ 千人访谈锚定的个体智能体。这条线定义了记忆流—反思—规划架构,也定义了当前最高的个体级保真度标尺。同组的 Whose Opinions(ICML 2023)与 CoMPosT(EMNLP 2023)则来自斯坦福的批判侧。
卡内基梅隆大学(Maarten Sap、Graham Neubig)
社会智能的可评测化与批判
SOTOPIA(ICLR 2024)与 SOTOPIA-π(ACL 2024)把开放式社会互动变成可评分基准;TACL 2024 的响应偏差研究则是"LLM 不能替代被试"最硬的实证之一。同一机构同时贡献建设与证伪,是这条线健康度的一个信号。
MIT Media Lab(Ayush Chopra、Ramesh Raskar)
可微 ABM 与规模化的量化权衡
GradABM(AAMAS 2023)把百万体 ABM 变成端到端可微计算图;AgentTorch 与行为原型方法(AAMAS 2025)是目前唯一把"规模与个体复杂度"权衡量化的工作。这条线连接了机制仿真与深度学习标定。
宾州州立与上海交大(Zhenhui Li、郑冠杰)
强化学习交通信号控制的主线
IntelliLight(KDD 2018)→ PressLight(KDD 2019)→ CoLight / FRAP(CIKM 2019)→ MPLight(AAAI 2020),配套 CityFlow(WWW 2019)与 CBLab(KDD 2023)。这一支方法成熟度高,但至今没有主会论文报告路口实测。
本文由作者按照 CC BY 4.0 进行授权