月耗万亿Token:金山办公为什么不自己训练大模型

万亿Token背后的算力军备竞赛,金山办公为何不跟?

大模型训练的成本早已不是秘密:GPT-3需要约3640 PF-days的算力,数千张A100/H100显卡连跑数周甚至数月,预训练成本动辄千万美元。而到了Llama 3,训练数据量已飙升至15万亿Token,单次训练成本超过3000万美元。月耗万亿Token只是冰山一角——这还没算上推理成本(每月按量使用时,OpenAI需卖出1.85万亿Token才能回本)。对于金山办公这样一家以办公软件为核心的企业,其核心利润池远不足以支撑如此高额的算力军备竞赛。与其掏空家底追逐“从零预训练”,不如将资源集中在自家产品场景的深度优化上。

小模型的“降维打击”神话:参数量小≠能力弱

Mistral 7B仅70亿参数就能匹敌Llama 1 34B,Mixrel 7B同样证明了小模型在语言表达和知识获取上已可媲美大模型。更关键的是,预训练数据的质量正在取代数量成为决定性因素——Bloomberg用3630亿金融领域Token+3450亿通用Token训练出500亿参数的金融大模型,效果远超同等规模通用模型。金山办公完全可以采用“联邦小模型”策略:在应用侧做好分发,用参数小、数据垂直的模型(如专门处理文档格式、表格计算的模型)来满足用户需求,花小模型的钱,享大模型的福。

月耗万亿Token:金山办公为什么不自己训练大模型

自研不如调用:更聪明的成本与效率策略

预训练成本 = (模型参数量 × 6 / A100每秒计算次数) × 显卡租用成本 × 训练数据Token量。这个公式赤裸裸地揭示了:参数量越大、Token越多,成本指数级上升。而金山办公的产品需要的是稳定性、低延迟、高性价比推理。如果自己训练,不仅要承担数千万美元的一次性成本,还要应付每月推理资源消耗(按OpenAI计算,月消耗1.85万亿Token才能回本)。相比之下,调用成熟大模型(如GPT-4o、Claude等)的API,按Token付费,每月成本可控,还能快速迭代。此外,通过SFT(指令微调)和RLHF/DPO对齐,金山办公可以用少量高质量指令数据(万级到百万级)教会现有模型适应办公场景,无需从头预训练。

垂直场景的“数据护城河”:自己训练不如嫁接

预训练数据垂直化能显著降低模型参数需求。Bloomberg金融大模型仅用500亿参数就覆盖了金融领域的复杂逻辑,靠的是高质量金融数据。金山办公拥有海量的办公文档、表格、演示数据,这些数据天然适合做SFT和微调,而非预训练。如果直接调用通用大模型再嫁接垂直数据,不仅成本低,还能利用基础模型的通用能力(如逻辑推理、代码生成)。目前学术界已有“小模型在推理能力上较弱但有途径解决”的突破,金山办公可以等待技术成熟后,用更少的Token实现推理能力的提升,而不是现在砸钱去赌Scaling Law。

从“军备竞赛”到“效率革命”:金山办公的务实选择

大模型行业的趋势已从“Scaling Law”转向“Efficiency Law”——数据质量和训练效率比单纯扩大规模更重要。DeepSeek等团队通过数据清洗和工程优化,用更少的资源达到了媲美GPT-4的效果。金山办公不自己训练大模型,本质上是遵循了“没有最大的模型,只有最合适的模型”这一原则。他们可以像知乎张俊林老师所说,关注小模型的语言表达和知识获取能力,通过“联邦小模型”分发,在用户端实现“花小模型的钱,享大模型的福”。这种务实策略,远比盲目跟风训练万亿Token更符合商业逻辑。