半泽直树

腾讯混元发布首个AI科学家Hyra!简单有效,能递归自我改进_我的网站

请回答1988

一 |     Sophie 编译 夏季开始了,一股即将到来的亚热带气团将给北岛带来一个闷热的开端,可能会有大雨。         塔斯曼海上空形成的低压系统将把亚热带的湿气带过来,预计下周北岛上部将有几波潮湿空气通过。    专注AIGC技术的专业社区,关注大语言模型(LLM)的发展和应用落地,聚焦LLM及AI技术的市场研究和开发者生态,欢迎关注!               递归自我改进与自动化研究正成为 AI 领域最活跃的前沿问题。         Advertise with us          “周日和下周,湿度水平有时可能达到夏季标准。”Niwa气象学家Ben Noll说。Agent 们正在开放式科学发现里超过人类。         Google DeepMind 的 AlphaEvolve 把 4×4 复数矩阵乘法压到 48 次标量乘法,Together AI 用一群 Agent 把 11 维 kissing number 下界从 593 推到 604,Karpathy 的 autoresearch 给了极简自动训练研究框架。         “如果你走到户外,你会注意到这一点。         腾讯混元刚刚发布了首个 AI 科学家 Hyra(Hunyuan Research Agent,混元研究 Agent),定位是能递归自我改进的研究型 Agent。”          当气温高到让我们出汗,而空气中又有足够的水蒸气时,我们就会真正开始感到黏糊糊的。

二 |          Noll提到了下周一些预测的露点值——露点是指在特定温度下,空气中的水蒸气开始凝结成液态水,比如草上面会有凝结的水。         它用一套极简脚手架,跑通了十多个自我改进和自动化研究场景里的真实任务。         Hyra 把智能和算力换成可验证的成果,AI for AI、AI for Science、AI for Fun 三条线都有具体产出,部分数学题和 GPU 内核优化还刷新了业内已知最好成绩。         这也为我们将感受到的闷热提供了一个更好的指标,而不是天气预报中通常使用的“相对湿度”。         “下周,在奥克兰这样的地方,露点将在15摄氏度以上,有时甚至高达18摄氏度或19摄氏度。

三 |          Hyra 长什么样          Hyra 的设计哲学来自 Rich Sutton 那篇经典的 The Bitter Lesson(苦涩的教训),框架尽量轻,给 Agent 留足动作空间。”          “这取决于个人的情况,但一旦露点达到16摄氏度或17摄氏度左右,情况就会变得有点不舒服。”          “我们预计会有三到五天的时间,在这段时间里,会感觉天气有点湿热。         拿到一个任务描述,Hyra 会跑一个持续循环,从过往经验里找灵感,迭代出更好的方案。经验包括执行日志、评估器反馈、源代码、之前方案留下的工件。”          据MetService报道,随着闷热天气的到来,也可能会出现暴雨,特别是从周六下午到周日的Westland地区。

四 | 循环一直跑,直到 Agent 自己决定停下或者算力预算耗尽,最后交回最优解。         上图是 Hyra Harness 的核心循环。Context Agent 维护经验库,不断往任务队列里加新的灵感上下文。多个 Proposal Agent 从队列取灵感,写出更好的方案。每个方案以 solve.sh 为入口,在隔离沙箱里跑一遍拿到分数,再把工件交回经验库。

五 |          具体看,Context Agent(上下文 Agent)维护一个 Experience Bank(经验库,简称 EB),记录所有方案和评估结果,再把 EB 里的素材合成为 Inspiration(灵感)丢进任务队列。

六 | 每个灵感是一坨上下文,可能含代码、文件、工件、日志,把探索过程里学到的东西打包传递下去。         一股雨带横贯了北岛,正带来大量的雨水和逐渐增强的西北风,尤其是在北岛南端附近。         多个 Proposal Agent(提案 Agent)从任务队列拿灵感,反思后写出一个新方案,落到 solution/ 目录里,入口是 solve.sh。         同时,南岛南部的天气预计将较为干燥,而来自南部的气流可能会给Marlborough Sounds以南的东部地区在下周初带来凉爽的天气。         Noll说,在未来几周,北方可能会有更多闷热的天气。方案在隔离沙箱里跑一遍,拿到分数,再把结果送回 EB。

七 |          整个系统是异步的生产者-消费者管线。         “随着下月的到来,我们似乎会有更多的机会迎来这种潮湿的天气——尽管真正出现类似的热带气候的时间是12月初。Context Agent 持续填灵感,提案 Agent 消费队列,方案在沙箱跑评估后回传 EB。信号量控制并发,让方案质量随时间稳定提升。         任务连评估器都没有时,Hyra 会升级成双层循环。先从任务描述生成一个初始评估器,内层循环拿它反复改进方案。         内层结束后,Hyra 用 EB 里攒下的经验去改评估器,让评估代码更高效,降低 reward hacking(奖励作弊)风险,加上更细颗粒度的反馈。

八 | 下一轮用升级后的评估器重开。”          Noll表示,虽然这些亚热带气候模式更像是拉尼娜气候周期,但它强调了一个事实,即使在厄尔尼诺气象系统下,新西兰上方的西太平洋仍在保持温暖。         举个具体例子。         “在夏季,我们会不时地受到来自北方的气流的影响——可能相对较少——然后其他时候,我们将会受到来自澳大利亚的更干燥、湿度较小的气团的影响。任务是设计一个世界冠军级别的国际象棋 AI,初始评估器可能用随机生成的对手群搞 Elo 评级。循环跑下去,那些随机对手会被 EB 里记录的更强 AI 替掉,评估器和方案一起往上进化。         AI 训 AI,跑赢同行          基础模型研发本身有大量可执行、可评估、可迭代的研究环,是 Research Agent 最天然的应用场景。训练配方、数据策略、训练和推理系统、底层 kernel、评估框架,都需要研究员提假设、写代码、跑实验、看反馈再改。Research Agent 能把每次成功和失败都变成可复用经验,迭代速度远超人工。         Hyra 在 Recursive 公开的三个任务上做了对比测试,NanoChat Autoresearch、NanoGPT Speedrun、SOL-ExecBench,分别对应固定预算训练、训练加速、GPU kernel 优化。

九 | 沿用 Recursive 的任务定义、评估协议和初始方案,公平较量。         三个任务都跑赢 Recursive。

十 | 注意几个任务已经被研究社区反复打磨过,基线本身已经很强。         NanoChat 上,Hyra 要在固定预算里平衡模型架构、优化器设计、学习率策略、数据流和执行效率,最后把 Validation BPB 压到 0.9015。”          “我预计我们不会像去年夏天那样经历那么多潮湿的亚热带天气——但在某种程度上,我们下周看到的情况将在整个夏季重复出现。”          Niwa将于明天发布12月至2月期间的气候展望。         NanoGPT Speedrun 是社区精修过的加速榜,提升空间很小,Hyra 把达到 3.28 验证损失的时间从 77.5 秒压到 76.4 秒。         相关阅读:          暂时温暖别大意,寒冷天气蓄势待发!24小时内气温或骤降10度          奥克兰发布强雷暴监测!下午和晚上北岛或遭遇暴雨和冰雹          恶劣天气又要来了!新西兰多地发布暴雨和强风预警          本周奥克兰等地将有零星阵雨或大雨,周末天气会很好          本周又是天气不稳定的一周 气象部门已发布橙色暴雨警告          全国各地气温骤降,南岛大范围降雪,周末奥克兰多云多雨          假期结束,风雨来袭!奥克兰的雨下午就到!          天气异常变化:本周五,新西兰这里将下雪          厄尔尼诺来袭 新西兰今夏出现热带气旋的风险有多大?          炎热干燥!今年夏天新西兰的气温或将飙升至39度          厄尔尼诺现象来了!几周之内,新西兰气候会发生怎样的巨大变化?          厄尔尼诺来袭 2024或成史上最热一年          “厄尔尼诺”在路上,全球天气会受何影响?          科学解释:今年雨水为什么格外泛滥?何时到头?          注:本文为编译/原创,欢迎转发分享;但严禁复制等未经授权的非法使用。违反上述声明者,本网将追究其相关法律责任。         SOL-ExecBench 上,Hyra 联合优化 235 个 GPU kernel 的真实负载,Mean SOL 做到 0.771。

十一 | 使用授权请联系[email protected]。

十二 |          chineseherald.co.nz All Rights Reserved 版权所有          (责编:Sophie)          相关内容                夏季严打:奥克兰警方上周末抓到19人酒驾,37名司机被开罚单           工党官宣第54届国会团队阵容 部分资深议员排名大跌           奥克兰市长公布交通新计划:乘坐公共交通每周封顶50纽币           奥克兰北岸华人被袭案:嫌犯因精神错乱被判无罪           夜间奥克兰北岸和南区发生两起大火,居民被疏散,一学校今晨关闭           奥克兰北岸路上有一名男子死亡!死因不明,警方正在调查           【先驱自媒】新西兰总理改中文名了!办公室曝光,长这样……           【先驱自媒】奥克兰市长一年出访4次 上任一年自评为“7分”。         三个任务覆盖训练算法、训练系统、底层 kernel,同一套研究环能跨不同反馈环境继续产出可执行、可验证的改进。

十三 |          搜索越强,评估器越早被钻空子。         NanoChat 里有个方案把因果语言模型改成接近双向注意力的结构,让未来 token 提前泄露,BPB 假性变低。SOL-ExecBench 里有个方案在正确性检查时缓存输出,在计时阶段跑空 kernel,分数好看但没真正解题。

十四 |          光优化最终分数不够,评估本身必须进研究环。方案搜索越强,评估器和验证管线得跟着进化,才能把真进步和 reward hacking 区分开。

十五 |          AI for AI 还有一个隐性闭环。

十六 | 强 Research Agent 加速模型、训练系统、基础设施的研发,更扎实的 AI 系统反过来又把下一代 Research Agent 推得更强。         科学难题上的新答案          数学这块,Hyra 收集了 55 个开放数学问题,来自 EinsteinArena 和 Erich's Packing Center 等来源,很多几十年没动过。

十七 | Hyra 在其中 29 个上拿到了新的最优已知结果。         它还会从实验数据里挖规律。给它 1749 到 1932 年的月度太阳黑子数据,Hyra 找到了一个能预测黑子数的递推关系,在 1932 到 2026 年近一个世纪的样本外数据上 R² 达到 0.77。         同样思路可以分析 AI 模型训练日志,挖出 scaling law(缩放定律),反过来指导训练配方设计。         除了挖规律,Hyra 还能直接设计科学和工程工件。

十八 | 三个代表性例子。

十九 |          第一个是超小 Transformer。

| Hyra 设计了一个只有 15 个可训练参数的 Transformer,能做两个 10 位数相加。比 AdderBoard 上 36 个参数的公开纪录少 58.3%。Hyra 能在严格资源约束下联合搜索模型架构和计算机制,对研究神经网络极限和模型压缩有参考价值。         第二个是量子计算里的 qubit routing(量子比特路由)。逻辑量子比特要映射到物理芯片上有限的耦合拓扑,非相邻比特之间的操作通常需要插入 SWAP 门,带来双比特门开销和噪声。         Hyra 设计的路由算法在 IBM Q20 上比经典 SABRE 方法提升 44.4%。

| 同一个 24-CX 路由窗口里,SABRE 插了 15 个 SWAP,Hyra 一个没用,把 CX 等价双比特门从 69 个压到 24 个,降幅 65.2%。双比特门少,执行时间短,累积误差也小。         第三个是药物设计。PARP1 是 DNA 损伤修复里的关键酶,和同源重组修复缺陷的肿瘤细胞有合成致死效应,是精准肿瘤学里的热门靶点。Hyra 拿到 PARP1 结合口袋,生成有稳定结合的类药候选分子。从布洛芬出发,Hyra 设计出一个得分 -10.60 的分子,超过了已上市 PARP 抑制剂 olaparib(奥拉帕利)的 -9.77,综合了对接打分和类药性。         还能玩出点花来          除了搞模型和搞科学,Hyra 在游戏、设计、内容创作等开放域也能玩。这类任务通常没有唯一正确答案,靠自对弈、自评估、用户反馈不断打磨策略和工件。         第一个是黑白棋(Othello)机器人。

| Hyra 通过自对弈不断改进。评估器搞双循环赛,新候选方案和 EB 里高分机器人对战,按 Elo 保留前 k 名,对手池越来越强。策略从 minimax 搜索进化成 AlphaZero 风格 PUCT 加 MCTS 的混合打法。最终机器人在 Botzone 平台 730 个参赛作品里排第三,对手大多是北大计算机系学生。         第二个是从单张 2D 参考图生成 3D 结构。

| VLM(视觉语言模型)当评委,按剪影、比例、结构完整性、材质、视觉相似度打分。Hyra 反复修改建模代码和渲染参数,多轮探索后产出的模型比 Claude Code 的 Goal 模式更接近参考图,也更符合人类审美偏好。         第三个是给一段旋律做多乐器编曲。内层循环用规则评估器检查和声、和弦进行、节奏密度、音区冲突等指标。外层循环根据用户反馈调整评估器,慢慢学到那些很难事先形式化的偏好。

| 7 轮迭代下来,同一段旋律从保守的、像赞美诗一样的四声部编配,长成有减和弦、六和弦、灵活节奏和丰富配器的多乐器版本。         反馈来自对手、视觉模型或真实用户时,Hyra 也能把模糊目标转成可迭代搜索的过程。评估标准跟不上的时候,求解器和评估器在双层循环里一起进化。

|          Hyra 团队自己也说,目前这些 demo 还只是初步成果。下一步要做的是定义更有价值、有持续改进空间的任务。除了公开榜单,腾讯的产品系统、真实 AI 研发流水线、科学和工业场景,都可以变成可执行、可验证、有清晰反馈的问题。这样能跑起来 scaffold–data–model 三者的循环进化。

|          更好的脚手架催生更强的模型,更强的模型反过来又把脚手架和发现推到新高度。未来几代 Hy 模型甚至一些腾讯产品,都会和 Hyra 一起协同进化。         参考资料:          https://hy.tencent.com/research/hyra。

|

Current article:http://4a2g.roubutianquegumaigoubingdian.cyou/3p8cgn/20260826/78152.html

Published on:10:11:43


相关新闻

忏悔录

13:01:59

猎魔人

18:37:14

非你莫属

00:19:35

热门推荐

  • 台风“紫檀”引发洪涝 两部门针对广西启动国家四级救灾应急响应
  • 泽连斯基:我向他提供过4个政府岗位,都被拒绝了
  • “特朗普竞选团队正积极考虑黑利作为竞选搭档”,法新社点名可能人选
  • 2025淘宝京东618活动口令红包攻略:京东618最新红包口令是:红包588
  • 区委常委会第一百六十六次会议召开
  • 从阿里官方服务商到全链路跨境平台,锦泰宏十年深耕铸就外贸服务标杆
  • 引爆万店增长,掘金万亿俄罗斯!
  • 8月1日至21日巴西大豆出口量为688万吨
  • Alimony Rights: क्या तलाक के बाद पति को भी मिलता है एलिमनी का पैसा, जानें क्या कहता है नियम
  • 房地产板块走高 市北高新涨停
  • 半泽直树版权所有 本站点信息未经允许不得复制或镜像 法律顾问:年轻气盛 不能说的秘密
  • 伐木累 copyright ? 2000 - 2019
  • 等着我 刘銮雄太太第三胎 花木兰传奇 听见你的声音