增强推理性能观测
该版本支持标记需要分析的代码区间,并查询已缓存的编译图数量,帮助定位训练或生产推理中的意外编译。主机到设备的数据传输也经过调整,以避免不必要的张量复制。
推进注意力内核与 GPU 支持
新版为 TPU 推理引入支持变长序列的分页注意力内核,可混合处理预填充和解码。发布说明还介绍实验性 JAX 桥接,并恢复 GPU 持续集成;CUDA 支持仍属实验阶段。
官方更新加入性能分析与编译缓存观测能力,并改善 TPU 上的分页注意力实现。
以上日期为官方原文发布日期 · 本文为行业资讯简述
该版本支持标记需要分析的代码区间,并查询已缓存的编译图数量,帮助定位训练或生产推理中的意外编译。主机到设备的数据传输也经过调整,以避免不必要的张量复制。
新版为 TPU 推理引入支持变长序列的分页注意力内核,可混合处理预填充和解码。发布说明还介绍实验性 JAX 桥接,并恢复 GPU 持续集成;CUDA 支持仍属实验阶段。