两名工程师 + Codex,OpenAI 用 Rust 重写了扛住十亿人的存储系统

OpenAI官方日前罕见披露了旗下支撑ChatGPT、Codex及API服务的核心在线存储平台Habitat的完整演进历程:这个两年前还只是连接单个数据库的小型Python客户端库的系统,如今已成长为横跨约40个地理区域、承载500PB以上数据、处理7000万+QPS、服务超10亿周活用户的分布式存储巨兽。

OpenAI内部存储平台Habitat两年内完成从单库到分布式巨兽的跨越

Habitat的演进可分为两个关键阶段:

  1. 2024年中期为Python客户端库阶段:产品工程师无需关心schema查找、路由、鉴权、加密、序列化、连接池等底层逻辑,数据直接存储在Azure Cosmos DB中,因使用门槛低、无需强推就在内部迅速流行。
  2. 2025年中期升级为Python服务阶段:库模式的致命缺陷暴露——任何升级都需要协调几十个业务方进行滚动部署,仅一次为缩小单区域故障影响面的路由变更,就花费了数天推送功能开关、进行影子流量验证、修复bug,最后上线前还有团队因无关原因回滚。同时Python架构带来了asyncio调度抖动、连接池LIFO亚稳态失败、下游连接风暴等稳定性问题,峰值仅能扛住2000万QPS,远无法匹配业务增长需求。

仅2名工程师搭档Codex,2026年Q2完成Habitat核心系统Rust重写

OpenAI团队很早就预判到Python架构无法支撑未来的规模增长,本可以提前启动重写,但最终做出了一个大胆的决策:先用Python快速落地扩张,等技术债积累到必须解决时,再借助未来的AI开发工具降低迁移成本。这一赌注在2026年第二季度正式兑现:团队仅投入2名工程师,借助Codex与GPT-5.5的辅助,将Habitat核心系统完全用Rust重写。新版本目前已承接95%的生产流量,CPU效率较Python版本飙升6倍,内存效率提升15倍。这也是行业内首次将“把技术债留给未来更强的AI模型偿还”的理念落地实践,打破了传统认知中“技术债必须由当期工程师加班偿还”的定式。

Rust重写一举解决Python版本多项核心性能与稳定性痛点

Python版本在规模扩张中暴露的多重底层问题,在Rust重写后得到彻底解决:asyncio调度抖动导致的请求延迟不稳定、连接池LIFO策略引发的亚稳态失败及下游连接风暴等顽疾全部消失。Rust语言无垃圾回收、内存管理精准可控的特性,完美适配Habitat高并发、低延迟、高可用的核心需求,重写后不仅性能指标大幅提升,服务的稳定性也得到本质加强。此外Rust原生编译的特性也让Habitat的跨平台部署、资源占用都得到了进一步优化。

此次实践为行业高并发系统迭代与AI辅助开发提供新参考

这次OpenAI的技术实践对行业有两点重要参考价值:一是验证了在AI辅助开发工具成熟后,早期技术选型可以更侧重快速落地,不用过度担心未来的迁移成本,大幅降低了创新的试错门槛;二是再次证明了Rust在超大规模分布式核心系统中的应用价值,为同类系统的架构选型提供了真实可参考的案例。目前OpenAI的Codex CLI等内部工具也在推进Rust重写,进一步拓展Rust在内部工具链中的应用范围。