城市与人类系统仿真研究综述
从机制模型、时空预测和生成模型,到城市基础模型与大语言模型智能体,梳理城市及人类行为仿真的研究脉络、论文图谱与开放问题。
本综述梳理城市系统仿真与人类行为模拟两条研究线的演进,重点覆盖 NeurIPS、ICLR、ICML、AAAI、IJCAI、KDD、WWW、ICDE、CIKM、SIGSPATIAL、AAMAS 等计算机会议 2018 至 2026 年的工作,并向上追溯至 2010 年前后的机制模型阶段。全文按研究脉络组织,不按论文清单罗列;每条主线给出问题的变化、方法的替换和转折点的位置。所有条目标注发表出处的核实状态。
总览:这个领域到底在研究什么
“城市/人类仿真”在计算机会议上不是一个单一议题,而是四类目标不同的工作被同一个词覆盖。分清这四类是读懂全部文献的前提。
第一类是观测预测:给定历史观测预测未来观测,代表是交通流预测的时空图神经网络谱系。城市在这里只是数据源,不是被建模的对象。第二类是数据合成:生成不存在但统计上可信的个体轨迹或群体流量,动机来自隐私管制与数据稀缺,代表是从生成对抗网络到扩散模型的轨迹生成线。第三类是机制仿真:显式建模个体决策规则并让其交互,观察系统层面的涌现,代表是基于智能体的建模(ABM)、强化学习交通信号控制、流行病与经济仿真。第四类是行为模拟:用大语言模型扮演具体的人,复现其态度、选择与社会互动,代表是生成式智能体一脉。
2023 年以前,这四类基本各自独立发展,共享的只有数据集。2023 年之后发生了两件事:其一,第一类和第二类被”城市基础模型”合并——同一个预训练模型同时做预测、补全和生成;其二,第三类和第四类被大语言模型智能体合并——LLM 取代了 ABM 中的手写决策规则。本综述的核心判断是:真正的范式转折不在”用了大模型”,而在建模目标从拟合分布转向模拟决策过程,以及评价标准从预测误差转向跨城市泛化与行为有效性。
分类体系:建模对象 × 建模范式
横轴是被模拟的对象尺度,纵轴是产生行为的机制。同一个应用问题在不同格子里会得到完全不同的方法论,也会被送到不同的会议。
| 个体(单人 / 单车 / 单智能体) | 群体(区域 / 路网 / 社群) | 系统(城市 / 社会 / 经济体) | |
|---|---|---|---|
| 机制规则 手写方程或规则 | EPR 探索-回访模型、社会力模型、跟驰模型物理与交通工程刊物为主,CS 顶会几乎缺席 | 重力模型、辐射模型、Max-Pressure 信号控制被 CS 论文当作先验与基线复用 | SIR 类流行病 ABM、宏观经济 ABM、Schelling 隔离模型经典社会科学仿真,2023 后被 LLM 改写 |
| 判别式学习 观测到观测 | 下一位置预测、出行方式选择KDD / WWW / SIGIR | 时空图神经网络交通预测(DCRNN、STGCN、Graph WaveNet)ICLR / IJCAI / AAAI,2018–2022 主战场 | 城市区域画像、社会经济指标预测(UrbanCLIP、UrbanVLP)WWW / AAAI |
| 生成式学习 拟合并采样分布 | 轨迹生成:MoveSim → TS-TrajGen → DiffTraj → ControlTrajKDD / NeurIPS / AAAI,2020–2025 | OD 流量生成、人群仿真、三维城市生成KDD / SIGSPATIAL,正式发表通道偏少 | 城市时空基础模型:UniST、UrbanDiT、OpenCityKDD / NeurIPS,2024 后主线 |
| 决策优化 与仿真环境交互 | 单路口信控、单车调度KDD 2018 起 | 路网级多智能体 RL(CoLight、MPLight)、订单派发KDD / CIKM / AAAI | 税收政策设计(AI Economist)、城市空间规划 RL、疫情干预排程Science Advances / Nature Comp Sci / IJCAI |
| 语言模型智能体 模拟决策过程 | 生成式智能体、访谈锚定的个体孪生、LLM 出行日程生成UIST / NeurIPS / NAACL | 社交网络与推荐生态模拟(OASIS、Agent4Rec、AgentCF)SIGIR / WWW,大规模平台多为预印本 | 城市社会仿真(AgentSociety)、宏观经济(EconAgent)、参与式规划ACL / KDD / WWW,验证方法尚未统一 |
研究脉络:五个阶段
阶段划分依据是”主流论文在回答什么问题”,而不是技术名词的出现时间。每个阶段末尾给出把它推向下一阶段的具体工作。
核心问题是”能否用少量参数解释人类移动的统计规律”。EPR 模型用探索与优先回访两个机制解释个体轨迹的标度律,辐射模型用机会介入机制替代重力模型解释 OD 流量,TimeGeo 把这套机制接到手机信令数据上,实现无需出行调查的城市级出行生成。这一阶段的产出发表在 Nature Physics、Nature、PNAS,而非 NeurIPS 或 KDD。
它对后续的决定性影响不在方法,而在评价体系:回转半径分布、位移分布、访问频次幂律、探索率衰减,至今仍是所有深度生成模型论文必须报告的指标。这套指标在 2025 年被证明存在根本缺陷(见 07 节)。
问题从”解释”转向”预测得更准”。DCRNN(ICLR 2018)与 STGCN(IJCAI 2018)几乎同时把图神经网络引入交通预测,ASTGCN(AAAI 2019)加入时空注意力,Graph WaveNet(IJCAI 2019)提出自适应邻接矩阵,说明图结构本身可以被学出来。这四篇确立了时空图神经网络范式,PEMS 与 METR-LA 成为标准评测集。
与此并行的是强化学习交通信号控制:IntelliLight(KDD 2018)→ PressLight(KDD 2019)→ CoLight(CIKM 2019)→ MPLight(AAAI 2020),从单路口推到上千路口协同。这一支才真正需要仿真器,因为策略必须与环境交互,CityFlow(WWW 2019)因此出现。
问题从”预测下一步”变成”合成整条轨迹”。三重驱动力:隐私管制使真实轨迹越来越难获取;疫情期间需要反事实移动模拟;生成模型在其他模态上成熟。MoveSim(KDD 2020)把 EPR 式先验嵌入 GAN,是第一篇正式工作;TS-TrajGen(AAAI 2023)用两阶段 GAN 加路网搜索解决轨迹连续性;DSTPP(KDD 2023)用扩散建模时空点过程。
DiffTraj(NeurIPS 2023)是明确的转折点:首次把去噪扩散概率模型直接用于连续 GPS 轨迹合成,保真度大幅超越 GAN 与 VAE 基线。此后 ControlTraj(KDD 2024)、Diff-RNTraj(TKDE 2024)、Seed(WWW 2025)都在扩散框架内做可控性与路网约束的加法。
城市侧:问题从”为每个城市训一个模型”变成”训一个模型服务所有城市”。GPT-ST(NeurIPS 2023)做生成式时空预训练;2024 年 KDD 同时出现 UniST(prompt 驱动的原生时空通用模型)与 UrbanGPT(把时空编码器对齐进 LLM),两条路线的分歧在此刻确立;《Urban Foundation Models: A Survey》(KDD 2024)完成范式命名。到 2025 年,UrbanDiT(NeurIPS 2025)用扩散 Transformer 统一预测、补全、生成多任务,代表原生路线的收敛形态。
人类侧:Generative Agents(UIST 2023 最佳论文)用记忆流、反思、规划三模块给出可复制的架构模板,随后在社交网络(S³)、宏观经济(EconAgent, ACL 2024)、市场竞争(CompeteAI, ICML 2024)、推荐系统(Agent4Rec, SIGIR 2024)、公地治理(GovSim, NeurIPS 2024)、规范涌现(IJCAI 2024)横向铺开。SOTOPIA(ICLR 2024)第一次把开放式社会互动变成可评分的基准。
规模竞赛先于同行评议:OASIS 宣称百万智能体、AgentSociety 达到万级智能体与五百万次交互、SocioVerse 挂靠千万真实用户池——这几项至今均为预印本。与此同时批判性证据已经足够扎实:LLM 无法复现问卷响应偏差(TACL 2024)、无法复现变量间相关结构(Political Analysis 2024)、无法自发产生人类式极化(NAACL Findings 2024)、对弱势群体的画像系统性同质化(CoMPosT, EMNLP 2023)、在协调博弈中显著弱于人类(Nature Human Behaviour 2025)。
ICML 连续两届收录针锋相对的立场论文:2025 年 Anthis 等主张障碍可解,2026 年 Puelma Touzel 等直指”验证鸿沟”——评估稀疏、不一致、跨学科不共享,未经验证的系统正被过早用于政策场景。FAccT 2026 的机制可信度分级把”能复现现象”与”机制可解释”正式分离。城市侧的对应工作是 SIGSPATIAL 2026 用巴黎与上海真实数据检验 AgentSociety 与 CitySim,结论是语义活动分布尚可、行程长度分布与 OD 流系统性失真。
五条主线的内部演进
上一节按时间横切,本节按主题纵切。每条主线给出阶段划分、方法替换的具体路径,以及那篇改变了后续研究提问方式的工作。
这是唯一一条完整跨越 2010 到 2026 的主线,也是唯一一条评价指标被上游学科(复杂系统物理)设定的主线。它的内在张力在于:机制模型给出了可解释性和指标体系,深度模型给出了拟合能力,两者的融合始终没有完成。
结构性短板:学习型跟驰模型与微观仿真器自动标定这一支基本不在 CS 顶会,成果集中在 Transportation Research Part C、IEEE T-ITS、ACM TOMACS。这意味着 CS 侧城市仿真的底层物理并不扎实。
这条线只有四年历史,但完成了完整的乐观—扩张—质疑循环。它有两个独立起源:HCI 侧的 Social Simulacra(UIST 2022)把 LLM 当作合成人群生成器;社会科学与机器学习侧的 Out of One, Many 与 Turing Experiments(ICML 2023)把 LLM 当作可条件化的被试替代。两者共享同一前提:语言模型压缩了足够多的人类行为分布,因此可以被采样出人。
当前三个焦点分歧:(1)保真度应当用群体均值、分布形状、变量间相关结构还是个体一致性来度量;(2)百万智能体带来的是新涌现还是同一模型偏置的百万倍放大;(3)模拟应当被定位为假设生成器、政策沙盒,还是人类被试的替代。
这条线是 A 与 B 的交集,也是 2024 年以来产出最密集、团队集中度最高的方向。它的问题演进极为清晰:LLM 知不知道空间 → 能不能做城市任务 → 能不能当城市世界模型 → 该在系统里承担什么角色。
判断:"LLM 作预测器"这一角色已基本被证伪;"LLM 作知识源、调度器、仿真主体"三个角色被保留。综述若仍按"LLM 的五种角色"平铺会失真。
这条线不生产模型,只生产判断标准。它的重要性在 2024 年之后急剧上升,原因是前三条线的增速已经超出了验证能力。
这条线最值得关注的不是有多少论文,而是哪些真的部署了。把”论文声称的政策价值”与”文献中可查证的部署记录”分开列,是本综述认为最有解释力的组织方式。
一条可操作的经验规律:成功跨过断层的案例(洪水预警、地震预警、Green Light 信号配时建议)有共同结构——输出是信息而非管制,误报成本低,且不接管决策回路。管制型输出至今滞留在论文里。
趋势判断
以下十条是从上述脉络中提炼的判断,每条都可以被具体工作证伪或支持,不是泛泛的展望。
开放问题
按可操作性排序:越靠前越可能在两年内被解决,越靠后越接近学科层面的困难。
团队图谱
了解这些团队的分工,比逐篇读论文更快建立领域地图。
