9 月 21 日,AICC 2026 人工智能计算大会在北京中关村国际创新中心举行。本届大会设 1 个主会场、7 个分会场,近 60 场专题报告,来自芯片、存算、互连、系统、框架、Infra 与模型等环节的专家共同讨论同一个问题:当 Agent 从一次调用走向持续任务链,下一代 AI 需要怎样的计算体系。
易兜信息团队到会参与,重点旁听了与智能体推理成本、异构算力协同相关的分会场议程。
会上被反复引用的几组数字
- IDC《日活智能体数(DAA)研究报告》:全球活跃 Agent 数量 2025 年为 2860 万个,预计 2026 年达到 7940 万个,2030 年增长到 22.16 亿个。
- Gartner 2026 年 3 月报告:一个 Agent 工作流每任务消耗的 Token 量,是标准聊天机器人的 5 到 30 倍——因为单次用户请求通常会触发 10 到 20 次顺序模型调用。
换算到项目上就是一句话:智能体从「问答」变成「干活」之后,成本结构和稳定性要求,跟过去做一个对话机器人完全不是一回事。
带回来的三条判断
- 成本要在设计阶段算清楚。长周期任务的 Token 消耗不是线性增长,得在方案设计时就确定哪些步骤走大模型、哪些步骤走规则和工具。
- 关键步骤必须可中断、可确认。持续任务链一旦跑偏,代价比单次问答大得多——这也是方寸(Cubit)桌面端坚持「关键操作先确认」的原因。
- 异构算力是常态。客户手里的卡越来越杂,交付方案不能绑死在单一硬件与单一推理框架上。
本文配图来源:AICC 2026 大会公开报道
