据报道,Miles 团队在 Blackwell 架构上实现两种原生低精度强化学习方案,分别为端到端 MXFP8,以及面向 MoE 专家权重的逐 token NVFP4。团队在 8x B200 上对 Qwen3-30B-A3B 进行消融实验,结果显示,BF16 与五种低精度配置的原始奖励曲线高度重合,表明相关低精度配置在该实验设置下未明显改变奖励表现。同时,MXFP8 和 NVFP4 配置减少了推理时间,体现出在 Blackwell 架构上用于强化学习训练与推理流程的效率优化空间。
免责声明:含第三方意见,不构成财务建议
英伟达周一5%下跌期间散户买入1.08亿美元,逢低买入力度为2025年以来第三弱
1 小时前
SK hynix 二季度业绩显示芯片需求仍高,AI 与存储芯片股周三盘前回升
9 小时前
韩国总统李在明在旧金山宴请英伟达、博通、微软及韩国科技企业高层
2 天前
OpenRouter 2026年7月26日 LLM Token 用量榜:MiMo V2.5、DeepSeek V4 Flash、Hy3 位列前三
2 天前
OpenAI与微软更新合作,获得在所有云平台部署产品和服务权限
4 天前
芯片及AI相关股票周一下跌,市场等待科技巨头财报与美联储利率决议
4 天前
花旗称科技巨头财报将检验AI资本开支回报,电力与审批等约束开始显现
4 天前






