跳到主要内容
首页/新闻中心/技术实践
技术实践PyTorch 项目

PyTorch/XLA 2.7 改进多后端推理能力

官方更新加入性能分析与编译缓存观测能力,并改善 TPU 上的分页注意力实现。

以上日期为官方原文发布日期 · 本文为行业资讯简述

工程主题示意图,非活动现场照片

增强推理性能观测

该版本支持标记需要分析的代码区间,并查询已缓存的编译图数量,帮助定位训练或生产推理中的意外编译。主机到设备的数据传输也经过调整,以避免不必要的张量复制。

推进注意力内核与 GPU 支持

新版为 TPU 推理引入支持变长序列的分页注意力内核,可混合处理预填充和解码。发布说明还介绍实验性 JAX 桥接,并恢复 GPU 持续集成;CUDA 支持仍属实验阶段。

← 返回新闻中心