当前标签:显存优化
每秒狂吐1000个token!谷歌开源扩散模型新作,4090单卡可跑
每秒狂吐1000个token!谷歌开源扩散模型新作,4090单卡可跑——实际上,这是近期多项开源AI模型在消费级显卡上实现性能飞跃的综合报道,涵盖文本推理、视频生成和图像生成三大领域。
内存暴降50倍且精度无损,MIT提出注意力匹配,能终结大模型显存危机吗?
MIT提出Attention Matching技术,将大模型KV缓存压缩50倍且几乎不掉精度,有望彻底改变大模型推理的高显存困境。
DeepSpeed
DeepSpeed是由微软开发的开源深度学习优化库,专为大规模模型分布式训练打造,能显著提升训练效率与规模。