财经

openai发布最强推理模型o1:可解答83%的奥数问题-九游会官方网站登录

北京时间9月13日凌晨,美国openai公司发布全新模型技术产品o1,包括两种版本o1-preview和o1-mini,前者具有高级推理功能,在推理数学、编程、科学等问题的能力上有显著提高,性能接近理化生博士水平;后者则是一款更小巧、专为代码生成优化的模型。

这就是此前传言中高级推理能力强大模型的“strawberry”项目。也有人分析称,o1是orion大模型简称。

openai发布最强推理模型o1:可解答83%的奥数问题

openai表示,对于复杂推理任务而言,新模型代表着ai能力的崭新水平,因此值得将计数重置为1,给它一个有别于“gpt-4”系列的全新名号。同时,这也预示着,ai时代迎来崭新的起点——能够进行通用复杂推理的大模型重要到来。

需要注意的是,o1目前的聊天体验还比较基础。不同于其前身gpt-4o,o1目前无法浏览网页或处理文件分析功能。尽管它具备图像分析功能,但该功能暂时关闭,等待进一步测试。此外,o1还有消息量限制——目前o1-preview每周限额30条、o1-mini每周50条。

即日起,o1-preview 和 o1-mini两个版本已经在chatgpt plus/team和api接口渠道上线,企业和教育用户将于下周初获得优先访问权限。

openai ceo奥尔特曼(sam altman)表示,“这是我们迄今为止功能最强大、最一致的模型系列 o1,也是迄今为止我们最好的推理模型。虽然o1仍然存在缺陷并有限,但使用时的感觉依然更加令人印象深刻。”

openai发布最强推理模型o1:可解答83%的奥数问题

具体来看,openaio1可以解决比以前gpt时期的科学、编码和数学模型更难的问题。

openai的研究负责人jerry tworek透露,o1模型背后的训练与之前的产品有着根本性的区别。之前的gpt模型旨在模仿其训练数据中的模式,而o1的训练旨在让其独立解决问题。在强化学习的过程中,使用奖励和惩罚机制来“教育”ai使用“思维链”来处理问题,就像人类习得拆解、分析问题的方式一样。

o1上线之后,现在chatgpt可以在回答问题前先仔细思考,而不是立即脱口而出答案。就像人类大脑的系统1和系统2,chatgpt已经从仅使用系统1(快速、自动、直观、易出错)进化到了可使用系统2思维(缓慢、深思熟虑、有意识、可靠)。这让它能够解决以前无法解决的问题。

所谓推理大模型,就是ai会在回答之前花更多时间进行思考,就像人类思考解决问题的过程一样,而非预测单词生成的序列。比如通过文字点开ai思考的过程,还会出现ai表示“我在思考这个事情这么做行不行”、“啊时间不够了得尽快给出答案”等。openai确认,这里展示的并不是原始的思维链,而是“模型生成的摘要”,公司也坦率承认这里有保持“竞争优势”的因素。

根据测试,在国际数学奥林匹克(imo)资格考试中,gpt-4o仅正确解答了13%的问题,而o1模型正确解答了83%的问题。而在编程能力比赛codeforces中,o1模型拿到89%百分位的成绩,而gpt-4o只有11%。

openai发现,随着更多的强化学习(训练时计算)和更多的思考时间(测试时计算),o1的性能持续提高。而且扩展这种方法的限制与大模型预训练的限制有很大不同,openai也还在继续研究。

openai技术文件称,实验结果表明:o1超越了人类专家的表现,性能接近理科博士水平,成为第一个在该基准测试中做到这一点的模型。而在下一个更新的版本中,ai在物理、化学和生物学的挑战性基准测试中,表现能够与博士生水平类似。

除了openai o1-preview外,openai今晨也同步推出了o1-mini模型,更快、更便宜,定价也比preview版本降低了80%,适用于需要推理但不需要广泛世界知识的场景。

openai发布最强推理模型o1:可解答83%的奥数问题

很显然,尽管新的openai o1还不具备更全面问题解决能力,但显著提升的推理能力使其在科学、编程、数学等专业领域具备了更大的用途,以及 ai agent 相关技术的下限和上限被整体拉高,大幅提升科学研究和生产端的能力,对于消费端来说意义不算太大。

英伟达首席科学家jim fan表示,新的o1需要消耗更大的算力和数据,并且能够形成数据飞轮效应,正确的答案及其思考过程可以成为很好的训练数据。从而不断改进推理核心,类似alphago的价值网络随着mcts生成更多精炼数据而改进。

天风国际称,openai o1系列模型大幅增强推理能力,并宣布新的scaling范式:通过rl解锁test time compute(推理时间)。

此外,9月11日彭博社报道称,openai正在商谈以1500亿美元(约合10675.35亿元,1.07万亿元)的估值进行新一轮融资,有望从投资者那里筹集65亿美元,投资方包括苹果、英伟达、微软等。同时,openai还在谈判以循环信贷安排的形式从银行借款50亿美元。

成立于2015年的openai,一直处于科技行业向 ai 快速转变的中心,其发布的聊天机器人产品chatgpt于2022年首次亮相,引发全球 ai 投资热潮。openai首席财务官sarah friar近日在内部备忘录中表示,新一轮融资将支持公司对计算能力和其他运营费用的需求。她强调,该公司的目标是允许员工在今年晚些时候的收购要约中出售部分股份。

(责任编辑:zx0600)

推荐阅读

谁卡了openai的脖子?

随着谷歌、亚马逊等巨头推出 ai 产品,市场竞争变得更加激烈。

钛媒体 2024-07-03 15:10:14

马斯克梭哈xai,叫板openai

历时四个月,全球最大超级计算中心“supercluster”正式开始运转。

锌财经 2024-07-26 13:55:08

openai,等待下一任“金主”

或许是最后一次融资?

锌财经 2024-09-04 10:42:39

上升到人类存亡,openai内部互撕

openai的丑闻事件,居然已经上升到了人类存亡的历史高度。

锌财经 2024-06-17 15:50:52

openai被指存在“封嘴”离职条款,sam altman回应

风波不断的openai迎来宫斗戏第二幕。

蓝鲸新闻 2024-05-20 09:38:18

openai、百度、百川智能……大模型正在医疗领域火力全开

以openai为首的大模型企业们,正在全力开拓医疗市场。

动脉网 2024-08-09 11:07:29

大模型会自己“盗图”?这些坑openai已经踩过了

ai文生图,是原创还是盗用?

锌财经 2024-06-19 14:48:15

openai突然对中国“断供”api !多位从业者:影响不大,国产大模型更实惠

openai api突然对中国“断供”,国内套壳公司将受到重大影响?事实并非如此。

蓝鲸新闻 2024-06-27 14:46:55

真脱钩了?openai突然对中国断供api,国产大模型无痛搬家服务立即上线

但实际上,openai api停服这件事对于国内影响有限,主要原因在于国内大模型网站都需经过备案和审批。

钛媒体 2024-06-25 15:49:54

杨元庆称ai是联想史诗级机遇;openai将允许用户直接使用chatgpt;郑爽无财产可供执行;门店回应买保时捷送小米su7

杨元庆称ai是联想史诗级机遇;openai将允许用户直接使用chatgpt;郑爽无财产可供执行;门店回应买保时捷送小米su7。

市界 2024-04-02 14:19:50

山姆-奥特曼怒喷谷歌,gpt-4o抢了gemini风头

openai大战谷歌。

锌财经 2024-05-21 14:16:36

番茄小说被疑“签霸王合同”,作者联合抵制“ai协议”!

网友:这不是人机的矛盾。

北京商报 2024-07-24 09:04:38

人与ai战火再起!作者联合抵制番茄小说“ai协议”,日更万字不敌一键成文

ai大爆发之时,曾有人调侃称“我们希望机器人帮人类扫地、洗碗,是因为人类要去写诗、画画。

蓝鲸新闻 2024-07-23 14:10:32

大模型的 5 月:热闹的 30 天和鸿沟边缘

技术进化放缓引起的连锁反应。

晚点latepost 2024-05-30 10:24:18

市值突破500亿,兴全“一姐”乔迁“卖飞”领益智造

领益智造搭乘“果链”东风,股价在短短不到一个月涨超50%,市值突破500亿元大关。

环球老虎财经app 2024-07-09 17:06:01

一个行业洗牌的信号灯。

投中网 2024-07-01 14:36:46

8个月融15亿,创始人跑了仨

除了钱,啥都没有。

投中网 2024-08-29 14:37:56

九游会官方网站登录的友情链接

融媒体

中华网财经公众号
中华网财经公众号

九游会官方网站登录的联系方式

中华网新媒体 财经频道
互动/投稿邮箱:

网上不良信息举报电话:010-56177181
财经频道联系电话:(010)56176102
网站地图