本期编译精选。【导语】当新的AI模型撞到现场时,公司经常以BioMystery Bench,Gene Bench。Terminal-Bench等基准来引用他们的分数作为进步的证据。
当新的AI模型撞到现场时,公司经常以BioMystery Bench,Gene Bench,Terminal-Bench等基准来引用他们的分数作为进步的证据。但是这些测试有什么评价 分数甚至重要吗?我透过GPT-5.6、Fable 5.1和Opus 5的镜头,我并不期望他们能很快改善。系好安全带 深潜到数字和问题。
与硬件不同,你无法计算情报
任何个人的度量或测试都无法告诉你任何关于技术产品的信息。例如,一个GPU的3DMAK得分单靠它不足以告诉你在你的使用案例中会表现如何。或许你最喜欢的游戏更依赖于你的CPU,而不是你的GPU,这意味着图形卡之间的区别并不那么相关。然而,这些基准并非无用。如果你看看3Dmark的领跑板,这无疑是目前最强大的消费级GPU。
用硬件基准,最强大的产品得分最高,这里可以看到GPU和3DMAK(Credit:3DMAK/PCMag).
AI的基准不尽相同。例如,根据Anthropic,Opus 5在以编码为重点的Frontier-Bench中得分为43.3%,而GPT-5.6的得分为34.4%。但我更喜欢GPT-5.6,
RTX 5080在查看了他们的基准分数后,其表现会超过RTX 5090,这是不可想象的。但是即使一个特定任务的基准分数较低,却完全有理由选择一个AI模型而不是另一个。但是,如果基准实际上有价值,后者就不应该成为可能。
(原文共 10 张图片,此处展示前 3 张,更多图片请前往原文查看)
(编译自 PCMag;原文


本文系本站对该英文资讯的编译与转述,非全文翻译;版权归原作者所有。
每天 5 分钟,看懂世界在发生什么
订阅「牛金金天天译站」,每日精选海外科技/AI/文化资讯编译送到你邮箱。非经营性、无广告、可随时退订。
评论