左手推理成本暴降96%,右手性能反超大模型!当小模型学会了何时求助
当前大模型落地过程中,推理成本高企一直是行业核心痛点。顶级AI模型的API调用价格居高不下,以Astra API为例,标准价每百万token输入10美元、输出50美元,长上下文场景下价格还会翻倍,单次复杂请求的成本动辄数美元。相比之下,参数量仅4B的小模型输出价格可低至0.08美元/百万token,与顶级模型价差达数百倍,但受限于能力天花板,小模型往往无法独立完成复杂推理任务。如何平衡成本与性能,成为行业亟待解决的难题。
火思动力开源PyroDash:小模型获“求助自主权”
PyroDash是一种成本感知、token级的大小模型协同推理范式,整套系统由三个核心部件组成:可训练的小模型、保持冻结的大模型,以及负责执行交接的协同引擎