挑AI芯片芯片选型www.33abg33.net。光盯TOPS数字最容易翻车。

我见过一个团队买了标称256TOPS的卡,跑Transformer时吞吐还不如上一代128TOPS的。成绩不正在算力。正在内存带宽和软件栈。标称值常常正在幻念前提下测得,理想模子一跑就露馅的实战算力。AI芯片选型不能只看纸面参数。算力标称值有水分。INT8和FP16的TOPS不是一回事。浓密算力和浓密算力也差得近了。
英伟达H100的FP8很强,功耗700W,机柜供电和散热得重新算了值背。
选AI芯片时先领略场景,云端锻炼仍是边沿推理?锻炼看互联带宽,推理看提早和能效了。内存带宽比算力更容易成为瓶颈。年夜模子推理时。权重加载速度决议token生成速度。某国产AI芯片算力参数锦绣了,个圈HBM容量16GB,跑70亿参数模子就得切分,提早间接上去的。
理想测试时,拿实正在开业数据跑一遍,不要疑跑分。软件生态是隐形门槛。CUDA护城河深,良多AI芯片厂商供给迁移工具。自界说算子还得重写。
我试过把PyTorch模子转到某款国产卡,动态shape支撑不全,合腾一周。选型时问明晰,框架支撑、算子笼盖、社区生动度。功耗和本钱要算总账。边沿场景下,AI芯片的能效比(TOPS/W)比峰值算力重要。智能摄像头用5W芯片和15W芯片,散热计划完整差异。不要为用不上的算力买单,适宜比参数都俗更其实了。


