模型越来越强之后,Infra将被AI接管?
模型架构“膨胀”逼出Infra新难题
随着DeepSeek的MoE、Transformer压缩等新架构涌现,模型规模与复杂度呈指数级增长。vLLM committer莫梓峰指出,适配一个V4模型光是kernel就写了几个月,因为架构搞得太复杂。算法越强,Infra的适配成本反而越高,传统的“算法爷苦一苦Infra”模式正在失效。当模型架构以超出工具链进化速度的方式膨胀,Infra必须从“被动适配”转向“主动进化”,否则将沦为算力瓶颈。
Agent爆发让CPU重获“指挥权”
Agent工作流不再只是单次推理,而是包含规划、搜索、工具调用、结果验证等数十次模型调用。这种碎片化、动态化的负载,让CPU的角色重新凸显。AMD全球副总裁刘宏兵表示,云端多租户、沙箱执行、会话并发等场景对高核心数CPU的需求激增。阿里云容器服务负责人易立也强调,云要提供一整套让智能体安全运行、稳定交付、持续进化的平台能力,容器作为标准化承载方式,成为Agent落地的刚需。94%的受访者在Agent开发中使用容器,说明传统基础设施并未被抛弃,反而被强化。
算力“集散中心”如何把碎片拼成“大电脑”
中国AI产业存在典型错位:一边算力紧缺,一边已建成的数据中心里有大量芯片未被充分使用。无问芯穹提出的“前店后厂一中心”架构,试图解决这一矛盾。其中“一中心”是算力集散中心,通过跨区域、跨厂商的算力聚合,让模型能跑在16种芯片上,触达超3.7万P算力。这种“算力桥梁”将异构资源整合成一台“大电脑”,让Token生产(后厂)和AI生产力商店(前店)得以高效运转。
当AI学会自己搭底座:Infra运维的范式转移
软件工程“屎山”问题或许迎来转机。观点认为,模型能力越来越强,代码本身不再值钱,Infra工程师可能转向更高阶的SRE角色:定义好SLA、SLO和成本预算,剩下交给模型。这意味着Infra的运维逻辑将从“手写代码优化”转向“AI自动编排”。无问芯穹的Agentic MaaS平台单日Token调用量年增长40倍,增量来自真实产业场景,这正是AI自主管理Infra的雏形——当AI开始真正工作,底层的调度、内存、工具调用都需由AI系统自主完成。
网络通信创业潮:算力短缺的“解药”
模型参数越大、Token消耗越多,算力瓶颈就越突出。Upscale AI等初创公司专注AI网络通信,通过加快芯片间、节点间通信效率来“榨出”更多算力,成立不到一年融资超3亿美元。这反映出Infra创业的新方向:不再只是堆算力,而是通过底层技术创新(如光通信、低功耗方案)让现有算力发挥极致效率。当模型不断变强,Infra的瓶颈从芯片本身转向通信与调度,这恰恰是AI接管Infra的必经之路——只有底层足够高效,上层AI才能自主决策。