将27B模型“塞进”手机,PrismML推动AI进化从规模转向“智能密度”

加州理工教授另辟蹊径:挑战传统Scaling Law

AI模型的“Scaling Law”尚未走到尽头,增加算力、扩大规模仍能带来性能提升。但这一范式已无新意,且大尺寸模型在物理AI场景中受限于端侧设备的算力、能耗和体积。由加州理工学院教授Babak Hassibi创立的PrismML,正朝着完全不同的方向推进——不再继续堆算力和参数,而是将重点放在提升模型的“智能密度”上。

Babak Hassibi是加州理工学院电气工程、计算与数学科学教授,早在1990年代便参与提出神经网络剪枝方法Optimal Brain Surgeon。他此前还联合创办自动驾驶感知公司Neural Propulsion Systems,具备算法、芯片和硬件系统结合的产业经验。PrismML的联合创始人团队还包括Sahin Lale、Omead Pooladzandi和Reza Sadri,分别来自强化学习、二阶优化和系统工程等专业领域。公司此前种子轮合计募集1625万美元,Khosla Ventures和Cerberus Ventures参投,加州理工学院也参与融资,并与Google共同提供算力支持。

二值三值量化:把27B模型“塞进”手机

PrismML的技术核心并非传统4-bit、8-bit训练后量化,而是将整个语言网络——包括嵌入层、注意力层、多层感知机层和输出层——全部改造成二值或三值权重。在二值模型中,每个权重仅表示正、负两种状态,每128个权重共享一个FP16缩放系数,实际平均占用约1.125 bit;三值模型增加零状态,平均占用约1.71 bit,以稍大体积换取更高能力保留。同时,PrismML为这些权重开发专用推理内核,运行时直接读取压缩格式,无需重新展开为FP16,从而减少模型体积、内存带宽和推理过程中的数据移动。

2026年3月,PrismML推出全球首批具备商业可行性的1-bit大语言模型——1-bit Bonsai 8B。相比Llama3 8B,它体积缩小14倍,速度提升8倍,能效提高4-5倍,大小仅为1.15 GB,足以轻松装入一部iPhone 17 Pro。在iPhone 17 Pro Max上,推理速度约为44 tokens/秒。最新的Bonsai 27B基于Qwen3.6 27B打造,是同等能力级别中首款可在手机上运行的模型。在GeForce RTX 5090上,1-bit版本速度最高达163 tokens/秒,三值版本达134 tokens/秒。Bonsai 27B可通过MLX在苹果设备(Mac、iPhone、iPad)上原生运行,也可通过CUDA在NVIDIA GPU上运行。

智能密度新指标:衡量模型单位部署体积的能力

PrismML提出了评判模型的新概念——智能密度,用于衡量模型单位部署体积能够提供多少能力。它希望提高模型在有限内存、功耗和部署空间下所能承载的有效智能。1-bit Bonsai 8B与同参数规模其他模型相比,智能密度(每GB)显著领先。Bonsai 27B的意义在于,27B尺寸的模型可以实现更复杂的工作,例如多步推理、结构化工具调用、视觉任务,以及能够在漫长步骤中始终保持连贯的“计算机操作”智能体循环。

混合部署与端侧智能:解锁新应用场景

Bonsai 8B和Bonsai 27B解锁了一种全新的系统架构:混合部署。即把非极限和隐私敏感型任务路由给能力过硬的本地模型,同时将云端前沿模型保留给最困难的步骤。这将使智能体系统的单任务成本呈断崖式下降。在应用上,当高级模型变得足够小巧、快速且高效,足以在本地运行时,AI产品的设计空间将更宽广,例如:全天候运行的端侧智能体、实时响应的机器人、安全可靠的企业级Copilot、离线智能,以及专为受限环境(如带宽、功耗或合规限制)打造的AI原生产品。

从规模到密度:AI模型的下一轮进化

过去几年,AI模型沿着Scaling Law不断扩张:更多参数、更多数据、更大算力。它推动了能力跃升,也让模型越来越依赖数据中心、内存、带宽和电力。当AI进入企业系统、机器人、汽车和智能设备,这条路径开始碰到自己的边界。企业需要自己专有数据保持隐私,物理AI终端需要在真实环境中持续感知、判断和行动,它们都要求智能能够在本地运行,而模型体积和能耗正成为新的约束。这意味着,AI模型的下一轮进化可能从追求绝对规模,转向提升“智能密度”:让每个bit、每GB内存和每单位能耗承载更多能力。浓缩智能不再只是效率提升,它可能改变模型的演进方向,也重新定义AI产品的边界。未来的AI将分布在云端、边缘,以及两者之间的所有位置。