- 全部
- 默认排序
故事是这样的。前两天在AI芯片群里看到一个问题,有人问:大模型推理到底卡在哪里。问题描述挺详细的,说推理阶段,尤其是 token by token 生成的时候,延迟高得离谱。评论区有一群人在吵,有人说"上更大内存",有人说"换更硬的芯片",有人说"优化算法"。吵了半天,没一个说对。后来我花了一周时间
故事是这样的。前两天在AI芯片群里看到一个问题,有人问:大模型推理到底卡在哪里。问题描述挺详细的,说推理阶段,尤其是 token by token 生成的时候,延迟高得离谱。评论区有一群人在吵,有人说"上更大内存",有人说"换更硬的芯片",有人说"优化算法"。吵了半天,没一个说对。后来我花了一周时间

扫码关注












