初探 OpenAI GPT-4.1 性能:AI 编程能力大增,但谷歌 Gemini 依然称王
作者:周末游戏网时间:2025-05-06 14:59:00
本站 4 月 16 日消息,科技媒体 bleepingcomputer 昨日(4 月 15 日)发布博文,报道称 OpenAI 最新发布的 GPT-4.1 系列模型,其性能相比 GPT-4o 虽然实现重大飞跃,但多项跑分未能超越谷歌的 Gemini 系列。
本站昨日报道,OpenAI 公司发布 GPT-4.1、GPT-4.1 mini 和 GPT-4.1 nano,官方公布的跑分数据来看,这些模型在编程方面的能力,远超 GPT-4o 及 GPT-4o mini。
例如在 SWE-bench Verified 跑分中,GPT-4o 的得分为 21.4%,GPT-4.5 的得分为 26.6%,而 GPT-4.1 的得分为 54.6%。
尽管性能有较大提升,不过根据多位专家测试,相比较谷歌的 Gemini 系列,GPT-4.1 对比中却显露劣势。
根据 Stagehand(一款生产级浏览器自动化框架)发布的基准数据,Gemini 2.0 Flash 的错误率仅为 6.67%,精确匹配率高达 90%,且价格低廉、速度更快。相比之下,GPT-4.1 的错误率高达 16.67%,成本更是 Gemini 2.0 Flash 的 10 倍以上。
此外,哈佛大学 RNA 科学家 Pierre Bongrand 提供的数据也指出,GPT-4.1 的性价比不及 Gemini 2.0 Flash、Gemini 2.5 Pro 及 DeepSeek 等竞品。
在编码专项测试中,GPT-4.1 同样未能占据上风。Aider Polyglot 的测试结果显示,GPT-4.1 的编码得分仅为 52%,而 Gemini 2.5 则以 73% 的成绩遥遥领先。
值得注意的是,GPT-4.1 被归类为非推理模型(non-reasoning model),但其编码能力仍属行业顶尖。
相关文章
-
AI“立功”:谷歌去年封停了 3920 万个广告账号,超 2023 年三倍本站 4 月 17 日消息,据外媒 TechCrunch 报道,当地时间周三,谷歌宣布去年封停了 3920 万个广告主的账号,数量超过了 2023 年的三倍。谷歌表示,借助大语言模型和通过识别诸如商业
-
CounterPoint 报告 2025Q1 手机出货:三星同比增 1%、苹果增 14%、小米增 2%本站 4 月 17 日消息,市场调查机构 Counterpoint Research 昨日(4 月 16 日)发布博文,报道称 2025 年第 1 季度全球智能手机出货量同比增长 3%,中国、拉丁美洲
-
Meta 遭苹果、谷歌、Snap 吐槽:反垄断庭审现场幻灯片遮盖太敷衍本站 4 月 17 日消息,在今日的 Meta 反垄断审判中,苹果、谷歌和 Snap 的律师均对 Meta 周一展示的幻灯片表示不满。这些幻灯片被发现存在易于移除的遮盖内容,苹果和 Snap 的律师将
-
起亚探索 AI 驱动“声音景观”技术:让视障乘客用听觉“感知”旅行本站 4 月 17 日消息,如果你无法看到窗外的景色,却依然能感受到它的存在,那将是怎样的一种体验?对于许多视力受限的人来说,公路旅行往往只能依赖司机或其他乘客的描述。而据外媒 Carscoops 今
-
冲突再起:苹果 Apple Intelligence 被 Meta 拒之门外本站 4 月 17 日消息,科技媒体 sorcererhat 昨日(4 月 16 日)发布博文,报道称包括 Facebook、WhatsApp 和 Threads 在内,Meta 旗下应用选择禁用 A
-
微软最新报告教你“防诈”:如何避开 AI 生成的虚假招聘与诈骗网站本站 4 月 17 日消息,据外媒 Neowin 报道,微软 16 日发布了最新一期《网络安全信号报告》,详细说明了如何应对当今网络安全领域中的新型威胁、诈骗及欺诈行为,并阐述了 AI 如何使开发恶意