发布日期:2026-08-26 00:48 点击次数:79

多年来,科技巨头的首席实施官们一直宣扬AI智能体(AI agents)的愿景 —— 这类智能体可自主使用软件左右为东谈主类完成任务。但如今将消费者级 AI 智能体(不管是 OpenAI 的 ChatGPT Agent,已经 Perplexity 的 Comet)参预试验使用便会发现,这项时期的局限性仍十分昭彰。要让 AI 智能体具备更强的庄重性,卤莽需要行业尚未十足探索出的一系列新时期支握。
其中一项时期就是悉心模拟 “使命空间”,让智能体在其中接管多法子任务磨真金不怕火 —— 这种 “使命空间” 被称为强化学习(reinforcement learning,简称 RL)环境。正如带标签的数据集鼓舞了上一波 AI 发展海潮,强化学习环境正逐渐成为智能体诱导流程中的枢纽身分。
AI 研究东谈主员、创业者及投资者自满,当今顶尖 AI 实验室对强化学习环境的需求大幅增多,而有意提供此类时期的初创公司也不在少数。
“所有大型 AI 实验室齐在里面搭建强化学习环境,” 安德森・霍洛维茨基金(Andreessen Horowitz)粗鄙搭伙东谈主珍妮弗・李示意,“但可思而知,创建这类数据集的复杂度极高,因此 AI 实验室也在寻找能打造高质地环境与评估体系的第三方供应商。所有这个词行业齐在温煦这一领域。”
对强化学习环境的需求催生了一批资金丰足的新兴初创公司,举例 Mechanize Work 和 Prime Intellect,这些公司均戮力于在该领域占据最初地位。与此同期,Mercor、Surge 等大型数据标注公司示意,跟着行业正从静态数据集向交互式模拟转型,它们也在加大对强化学习环境的参预以跟上趋势。大型实验室相似在商酌大批投资:据《The Information》报谈,Anthropic 的处分层已接头狡计在改日一年内,为强化学习环境参预超 10 亿好意思元。
投资者与创业者们盼愿,这些初创公司中能出生出 “强化学习环境领域的 Scale AI”—— 这里的 Scale AI 是估值 290 亿好意思元的数据标注巨头,曾为聊天机器东谈主期间的发展提供了蹙迫支握。
当今的中枢问题在于,强化学习环境是否真能鼓舞 AI 时期冲突现存界限。
什么是强化学习(RL)环境?
从骨子上讲,强化学习环境是模拟 AI 智能体在简直软件左右中操作场景的 “磨真金不怕火场”。一位创业者在近期采访中边幅其构建流程 “就像制作一款十分没趣的电子游戏”。
举例,某个环境可模拟 Chrome 浏览器,并向 AI 智能体下达 “在亚马逊上购买一对袜子” 的任务。系统会对智能体的阐扬进行评分,若任务成效(即买到得当的袜子),便会向其发送 “奖励信号”。
尽管这类任务听起来相对毛糙,但 AI 智能体在实施流程中仍可能在多个枢纽出错:可能在网页下拉菜单中 “迷途”,也可能误购多双袜子。由于诱导者无法精确瞻望智能体可能出现的纰谬,环境自己必须具备满盈的庄重性,既能捕捉所有意新手为,又能提供有用的反应 —— 这使得构建环境的复杂度远高于创建静态数据集。
部分强化学习环境瞎想十分复杂,可支握 AI 智能体使用器具、拜访互联网或调用万般软件左右完成指定任务;另有部分环境则定位更细分,专注于匡助智能体学习企业级软件左右中的特定任务。
尽管强化学习环境如今是硅谷的热点时期,但使用这类时期的前例早已有之。2016 年,OpenAI 的首批名目之一就是构建 “RL Gyms”(强化学习场馆),其理念与当代强化学习环境高度相似;同庚,谷歌 DeepMind 的 AlphaGo AI 系统打败围棋天下冠军,该系统相似在模拟环境中汲取了强化学习时期。
如今的强化学习环境之是以具有私有性,在于研究东谈主员正尝试诱骗大型 Transformer 模子,打造能 “使用狡计机” 的 AI 智能体。与 AlphaGo(仅适用于封锁环境的专用 AI 系统)不同,如今的 AI 智能体旨在具备更通用的武艺。面前的 AI 研究东谈主员虽领有更坚实的时期最先,但规划也更为复杂,可能出现的问题也更多。
竞争热烈的领域
Scale AI、Surge、Mercor 等 AI 数据标注公司正积极顺应趋势,效劳打造强化学习环境。这些公司不仅比该领域多数初创企业领有更充足的资源,还与 AI 实验室修复了深厚的配协谋划。
Surge 首席实施官埃德温・陈(Edwin Chen)示意,近期已不雅察到 AI 实验室对强化学习环境的需求 “权臣增长”。他自满,Surge 客岁通过与 OpenAI、谷歌、Anthropic、Meta 等 AI 实验室配合,营收条称达到 12 亿好意思元;该公司近期已成就专门的里面团队,致密强化学习环境的搭建使命。
紧随 Surge 之后的是估值 100 亿好意思元的初创公司 Mercor,该公司相似与 OpenAI、Meta、Anthropic 有配合。TechCrunch 获取的营销材料自满,Mercor 正向投资者推介其中枢业务 —— 为编程、医疗、法律等特定领域任务打造强化学习环境。
Mercor 首席实施官布伦丹・富迪(Brendan Foody)在采访中示意:“很少有东谈主实在意志到,强化学习环境领域蕴含的机遇究竟有多大。”
Scale AI 曾在数据标注领域占据主导地位,但自 Meta 投资 140 亿好意思元并挖走其首席实施官后,该公司的商场份额逐渐下滑。尔后,谷歌和 OpenAI 不再将 Scale AI 列为数据供应商,以致在 Meta 里面,Scale AI 也靠近数据标注业务的竞争压力。尽管如斯,Scale AI 仍在戮力适应趋势,投身强化学习环境的构建。
“这恰是(Scale AI)所处行业的骨子,”Scale AI 致密智能体与强化学习环境的居品致密东谈主切坦・拉内(Chetan Rane)示意,“Scale 已讲明其快速适应的武艺:在咱们的首个业务板块 —— 自动驾驶领域的早期阶段,咱们作念到了这一丝;ChatGPT 问世后,Scale AI 也成效适应了新趋势;如今,咱们再次在智能体、环境等新前沿领域进行鬈曲。”
部分新兴企业从创立之初便专注于强化学习环境领域。成就约 6 个月的初创公司 Mechanize Work 就是其中之一,该公司建议了 “完了所有使命自动化” 的骁勇规划。不外,诱骗独创东谈主马修・巴尼特(Matthew Barnett)向 TechCrunch 自满,其公司当今正从为 AI 编程智能体打造强化学习环境起步。
巴尼特示意,Mechanize Work 狡计为 AI 实验室提供极少高庄重性的强化学习环境,而非像大型数据公司那样打造大批毛糙的强化学习环境。为此,该初创公司为软件工程师开出了 50 万好意思元的年薪(用于构建强化学习环境),这一薪资远高于在 Scale AI 或 Surge 从事小时工性质使命的薪金。
两位知情东谈主士自满,Mechanize Work 已启动与 Anthropic 配合诱导强化学习环境。对此,Mechanize Work 与 Anthropic 均休止就配合细节置评。
另有部分初创公司押注强化学习环境在 AI 实验室以外的领域也将产生影响力。由 AI 研究员安德烈・卡帕西(Andrej Karpathy)、Founders Fund 风投、Menlo Ventures 风投支握的初创公司 Prime Intellect,正将其强化学习环境定位为行状中微型诱导者。
上个月,Prime Intellect 推出了强化学习环境中心,规划是打造 “强化学习环境领域的 Hugging Face”(Hugging Face 为 AI 领域驰名开源社区)。该平台旨在让路源诱导者得回与大型 AI 实验室同等的资源支握,同期在此流程中向诱导者出售狡计资源拜访权限。
Prime Intellect 研究员威尔・布朗(Will Brown)示意,在强化学习环境中磨真金不怕火具备通用武艺的智能体,所需的狡计老本可能高于以往的 AI 磨真金不怕火时期。因此,除了打造强化学习环境的初创公司,为这一流程提供算力支握的 GPU 供应商也将迎来机遇。
“莫得任何一家公司能独自主导强化学习环境领域,其范围太大了,” 布朗在采访中说,“咱们当今所作念的部单干作,仅仅尝试围绕该领域搭建雅致的开源基础设施。咱们的中枢行状是提供狡计资源,这如实是使用 GPU 的浅易进口,但咱们更着眼于弥远发展。”
能否完了范围化发展?
对于强化学习环境,当今尚未有定论的问题是:这项时期能否像以往的 AI 磨真金不怕火活动那样完了范围化发展?
以前一年,强化学习鼓舞了 AI 领域多项紧要冲突,包括 OpenAI 的 o1 模子、Anthropic 的 Claude Opus 4 模子等。这些冲突酷好紧要,因为此前用于雠校 AI 模子的活动如今正显现出 “收益递减” 的趋势。
强化学习环境是 AI 实验室对强化学习时期 “更大押注” 的一部分 —— 好多东谈主合计,跟着在该时期中参预更多数据与狡计资源,强化学习将握续鼓舞 AI 越过。OpenAI 致密 o1 模子的部分研究东谈主员此前自满,该公司最初之是以投资 AI 推理模子(通过对强化学习和测试时狡计的参预诱导而成),恰是因为他们合计这类模子具备雅致的范围化后劲。
当今,强化学习完了范围化的最好旅途尚不解确,但强化学习环境似乎是颇具后劲的标的。与仅通过文本回答奖励聊天机器东谈主不同,强化学习环境能让智能体在模拟场景中操作器具、使用狡计机完成任务 —— 这种口头固然对资源的破钞远更高,但潜在的答复也更大。
也有部分东谈主士对强化学习环境的发展长进握怀疑格调。曾担任 Meta AI 研究致密东谈主、现诱骗创立 General Reasoning 公司的罗斯・泰勒示意,强化学习环境容易出现 “奖励舞弊”(reward hacking)表象 —— 即 AI 模子为得回奖励而 “舞弊”,并未实在完成任务。
“我合计东谈主们低估了环境范围化的难度,” 泰勒说,“即就是当今公开可用的最好(强化学习环境),若不进行大幅修改,持续也无法深广使用。”
OpenAI API 业务工程致密东谈主舍温・吴(Sherwin Wu)在近期播客中示意,他对强化学习环境领域的初创公司 “握看空格调”。吴指出,该领域竞争相当热烈,且 AI 研究发展速率极快,要为 AI 实验室提供优质行状难度很大。
卡帕西(手脚 Prime Intellect 的投资者,曾称强化学习环境可能成为冲突性时期)也对所有这个词强化学习领域抒发了严慎格调。他在酬酢平台 X 的帖子中建议疑问:通过强化学习时期,AI 还能完了多猛进程的越过?
“我对环境与智能体交互握乐不雅格调,但对强化学习自己握悲不雅格调。” 卡帕西示意。
海量资讯、精确解读,尽在新浪财经APP
包袱裁剪:丁文武 j9九游会官方登录
上一篇:九游会J9中央政府的巨擘得到显耀复原-九游娱乐(China)官方网站
下一篇:九游会J9日蟾光半导体涨0.76%-九游娱乐(China)官方网站
