导读:内部智能体平均上下文已达6万,百度百舸开始优化推理基础设施
转自:贝壳财经
新京报贝壳财经讯(记者罗亦丹)记者9月23日获悉,针对智能体时代越来越长的上下文,百度智能云联合SGLang社区举办“Agent时代的推理基础设施”Meetup,探讨了多芯适配、上下文缓存、KV Cache优化、显存优化、MoE专家压缩和推理服务治理等议题,探讨Agent走向生产环境所需要的推理底座。
百度智能云主任架构师黎世勇在会上透露,“Agent(智能体)时代带来了很多的变化,典型的就是(上下文)序列的长度变得非常长,去年我们聊推理服务优化时一个典型的Workload还是输入4k、输出1k这种短输入的上下文,现在百度内部平均上下文在60k左右,而且还在继续往上涨,100k、500k都有可能。”
当前,Agent工作负载正在呈现长输入、多轮次、强复用的特征。因此,Agent时代的推理基础设施不能只关注模型一次“答得多快”,还要关注一项任务能否连续、稳定、低成本地完成。要实现这一目标,推理基础设施需要从底层硬件适配、计算效率优化到上下文管理进行系统性升级。
对此,百度介绍,面对超大模型部署,百度百舸通过权重零冗余分布式部署、显存占用优化和MoE专家压缩,释放更多显存空间,为长上下文和高并发任务提供资源支撑。在相关测试中,MoE专家压缩50%后,长输出和高并发场景下的输出吞吐峰值可达到原来的2.23倍。
而在多芯适配方面,sglang-kunlun插件打通SGLang与昆仑芯,降低模型迁移和适配门槛。百度百舸还推动SGLang社区建立硬件可插拔插件机制,并从芯片算子、任务下发和通信等层面进行优化。
百度智能云高级工程师董新宇称,依托插件机制,国产卡开发可复用70%至80%的CUDA生态经验。
编辑 杨娟娟
校对 柳宝庆
声明:市场有风险,投资需谨慎。本文基于第三方数据库发布,不代表本网观点,任何在本文出现的信息均只作为参考,不构成个人投资建议。如有出入请以实际公告为准。