当前标签:大模型训练
月耗万亿Token:金山办公为什么不自己训练大模型
月耗万亿Token的天文数字背后,是算力、数据和专业壁垒的三重考量,金山办公选择调用成熟模型而非自研,是商业与技术最优解。
马斯克也拥抱C语言了,大模型训练堆栈抛弃JAX,提速一个数量级
埃隆·马斯克旗下xAI团队宣布放弃深度学习框架JAX,全面转向C语言重构大模型训练堆栈,实现整体性能提升一个数量级,震惊业界。
LabelLLM
LabelLLM是一款专注于大模型对话数据标注的开源免费平台,帮助用户高效处理和标注对话数据。
DeepSpeed
DeepSpeed是由微软开发的开源深度学习优化库,专为大规模模型分布式训练打造,能显著提升训练效率与规模。
Cephalon端脑
聚焦AI算力的分布式应用部署平台,提供极高性价比的一键部署方案。