初探 OpenAI GPT-4.1 性能：AI 编程能力大增，但谷歌 Gemini 依然称王

作者：灵犀软件园时间：2025-06-15 16:22:50

本站 4 月 16 日消息，科技媒体 bleepingcomputer 昨日（4 月 15 日）发布博文，报道称 OpenAI 最新发布的 GPT-4.1 系列模型，其性能相比 GPT-4o 虽然实现重大飞跃，但多项跑分未能超越谷歌的 Gemini 系列。

本站昨日报道，OpenAI 公司发布 GPT-4.1、GPT-4.1 mini 和 GPT-4.1 nano，官方公布的跑分数据来看，这些模型在编程方面的能力，远超 GPT-4o 及 GPT-4o mini。

例如在 SWE-bench Verified 跑分中，GPT-4o 的得分为 21.4%，GPT-4.5 的得分为 26.6%，而 GPT-4.1 的得分为 54.6%。

尽管性能有较大提升，不过根据多位专家测试，相比较谷歌的 Gemini 系列，GPT-4.1 对比中却显露劣势。

根据 Stagehand（一款生产级浏览器自动化框架）发布的基准数据，Gemini 2.0 Flash 的错误率仅为 6.67%，精确匹配率高达 90%，且价格低廉、速度更快。相比之下，GPT-4.1 的错误率高达 16.67%，成本更是 Gemini 2.0 Flash 的 10 倍以上。

此外，哈佛大学 RNA 科学家 Pierre Bongrand 提供的数据也指出，GPT-4.1 的性价比不及 Gemini 2.0 Flash、Gemini 2.5 Pro 及 DeepSeek 等竞品。

在编码专项测试中，GPT-4.1 同样未能占据上风。Aider Polyglot 的测试结果显示，GPT-4.1 的编码得分仅为 52%，而 Gemini 2.5 则以 73% 的成绩遥遥领先。

值得注意的是，GPT-4.1 被归类为非推理模型（non-reasoning model），但其编码能力仍属行业顶尖。

初探 OpenAI GPT-4.1 性能：AI 编程能力大增，但谷歌 Gemini 依然称王
本站 4 月 16 日消息，科技媒体 bleepingcomputer 昨日（4 月 15 日）发布博文，报道称 OpenAI 最新发布的 GPT-4 1 系列模型，其性能相比 GPT-4o 虽然实现

阅读详情
无需截图，微软 Win11 将允许用户直接从屏幕中提取文本
感谢本站网友 OkayTech 的线索投递！本站 4 月 16 日消息，微软的 Windows 11 系统迎来一项备受期待的功能更新 ——“文本提取”，

阅读详情
科技昨夜今 0416：供应链数据称小米手机 3 月激活量中国第一；京东外卖利润率不超 5%；电影《流浪地球 3》宣布开机...
“科技昨夜今晨”时间，大家好，现在是 2025 年 4 月 16 日星期三，今天的重要科技资讯有：1、供应链数据称小米手机 3 月激活量中国第一、华为同比增速最快，雷军回应“感谢大家支持”小米华为成为

阅读详情
“电竞性能旗舰”荣耀 GT Pro 手机定档：4 月 23 日发布
感谢本站网友 Autumn_Dream 的线索投递！本站 4 月 16 日消息，荣耀手机官微今日宣布，定位“电竞性能旗舰”的荣耀 GT Pro 手机将于

阅读详情
消息称苹果 watchOS 12 将引入 Apple Intelligence 功能，依赖 iPhone 运行模型
本站 4 月 16 日消息，据彭博社记者马克・古尔曼（Mark Gurman）透露，苹果即将发布的软件更新中，iPadOS 19 将使 iPad 更加接近 Mac 的使用体验，而 watchOS 12

阅读详情
群晖 DS925+ 四盘位旗舰 NAS 上架：双 2.5G 网口、4GB DDR4 RAM，4999 元起
感谢本站网友 Quentin 的线索投递！本站 4 月 20 日消息，群晖现已在京东上架 DS925+ 四盘位旗舰NAS，其主打“双2 5G网口、双M

阅读详情

初探 OpenAI GPT-4.1 性能：AI 编程能力大增，但谷歌 Gemini 依然称王

相关文章

热门影评