币圈界报道:

英伟达新模型性能主张面临第三方验证考验

英伟达于8月11日推出具备300亿参数的开源模型Nemotron 3.5 Lightning,声称其在同等规模下运行速度达四倍领先,并将智能体任务执行成本压缩至Anthropic Opus 4.8的约三分之一。目前仅有部分指标获得外部机构实测支持,其余仍基于厂商自身测算。

核心性能承诺尚未全面通过独立检验

尽管英伟达在发布时强调多项技术突破,但截至目前,多数关键性能声明仍未得到公开可复现的第三方确认。企业在部署相关基础设施前,仍需依赖供应商提供的效率数据,缺乏透明度与交叉验证机制。

独立评估揭示实际表现与宣传存在差距

由非英伟达关联的基准测试机构Artificial Analysis对Nemotron 3.5 Lightning进行评估:其智能指数得分为24,较前代提升9分,与模型规模约为其四倍的OpenAI gpt-oss-120b水平相当;在DeepInfra预发布接口上测得中位输出速率接近每秒670个token,显著优于同类模型平均值。

合作方成果多未公开佐证

Ramp Labs将英伟达新路由工具NeMo Switchyard应用于内部编程基准测试,发现使用该系统可在维持模型性能前提下降低资源消耗。虽然其博文未披露具体削减比例,但英伟达博客称实现58%成本下降与33%时间缩短——此数据未获Ramp官方背书。其他合作方如Boomi、Classmethod、LangChain等虽被引用,但均未发布与所述结果一致的完整报告。

部分合作方存在利益关联未披露

Lila Sciences被提及在科学推理任务中优化了Lightning表现,而该公司正接受英伟达旗下风险投资部门NVentures的3.5亿美元融资。然而,英伟达发布稿中未说明这一投资关系,引发潜在利益冲突质疑。

模型文档细节揭示更多底层信息

随模型一同发布的卡片显示,其架构融合Mamba-2、混合专家(MoE)及注意力机制,比社交媒体简述更为精确。此外,训练数据中包含带有政治倾向与民族主义色彩的合成内容,已被过滤;在人口统计术语子集中,编码指代呈现男性与白人主导特征。这些披露反映出数据治理层面的复杂性。

历史信息披露模式引关注

英伟达此前因隐瞒加密货币挖矿相关GPU销售金额(超10亿美元)遭联邦集体诉讼,案件已进入庭审阶段。尽管此次发布与此无关,但其一贯的信息披露风格再次成为市场审视焦点。

全面对比与真实落地仍待验证

若能开展跨厂商、全维度的第三方对比测试,或有合作方主动公布原始数据与验证结果,将极大增强可信度。特别是当NeMo Switchyard从alpha版本走向生产环境稳定运行,且各合作方确认其引用数字时,才能真正支撑英伟达所提出的效率革命主张。