来客网

谷歌“新旗舰”Gemini 4“实测”平平

声明:本文转载自 「Popyard」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]
01

Gemini 4发布后遭内部质疑,基准测试成绩亮眼,但部分谷歌员工反映实际编码表现不佳,尤其在前端设计领域存在短板。谷歌否认相关说法,援引DeepMind负责人表态力挺。业界将此归因于"过度优化"痼疾,刷高基准分却忽视真实体验。

Gemini 4发布遭内部质疑,基准测分亮眼,实际编码表现参差不齐。

华尔街见闻提及,周三谷歌正式向外部发布Gemini 4 Argon,将其定位为公司长期研发的旗舰人工智能模型。

然而据彭博报道,尽管该模型在多项基准测试中斩获领先分数,部分有权限直接使用该模型的谷歌内部人员却对其实际表现持保留态度,尤其是在编码能力方面。

谷歌方面明确否认上述质疑,表示有关Gemini 4在编码等领域表现不佳的说法"不准确",并援引Google DeepMind负责人Koray Kavukcuoglu的表态为佐证。Kavukcuoglu上周在The Information主办的一场会议上表示:我对团队有充分的信心,在我看来,我们始终处于前沿是板上钉钉的事。

面对OpenAI和Anthropic在模型与产品双线推进的竞争压力,Gemini 4能否在真实场景中兑现承诺,对谷歌的搜索、广告及云业务均具有直接影响。消息传出后,Alphabet盘后涨幅明显收窄。

内部分歧:基准佳绩难掩实际短板

据彭博援引知情人士,Gemini 4在业界通用基准测试中表现良好,但在员工实际使用中效果明显打折,尤其在编码任务上暴露出明显短板。

0

评论 (0)