必一运动官方网站-科学健身服务机构
运动资讯
News
分类>>为什么让AI同时学多门课反而会让它偏科越来越严重?

这项由上海人工智能实验室主导的研究发表于2026年7月,论文以预印本形式发布在arXiv平台,编号为arXiv:2607.16850v1,感兴趣的读者可以通过该编号检索完整论文。
假设你是一位私人教练,同时带着五个学员:一个想练长跑耐力,一个想练举重爆发力,一个想练瑜伽柔韧性,一个想练拳击速度,一个想练游泳协调性。如果你给所有人制定完全相同的训练计划,结果会怎样?举重运动员可能练得风生水起,但瑜伽学员会因为太多力量训练而受伤;长跑学员可能进步飞速,但游泳学员几乎没有水感训练。每个人的需求完全不同,却被同一套方案对待,最终的结果往往是强者越强、弱者越弱。
现代大型语言模型(也就是像ChatGPT、DeepSeek这类AI系统)的训练,面对的正是这样一个难题。这些AI不是只学一件事,它们需要同时学会数学推理、物理解题、写代码、回答科学问题、理解指令……每一类任务对AI来说,难度和特性都截然不同。上海AI实验室的研究团队发现,现有的AI训练方法在处理这种多科目同时学习时,存在一个根本性的隐患——它们让AI越来越偏科,而且这个偏科的趋势会随着训练不断自我强化。
这个研究的核心贡献,是找到了这种偏科现象背后的真正元凶,并提出了一套名为组熵控制策略优化(Group Entropy-Controlled Policy Optimization,简称GEPO)的解决方案。在十三个不同类型的测试项目上,这套方法的综合表现超过了目前主流的所有同类方法。
在正式讲解这个研究之前,需要先理解一个关键概念——熵。这个词听起来很物理学,但其实可以用一个非常直观的比喻来理解。
把AI回答一道题的过程,想象成一个人在面对路口做选择。当这个人对路非常熟悉,他几乎不需要考虑,直接走上最常走的那条——这就是低熵状态,也就是AI非常确定自己要给出什么答案,它的选择空间很窄,几乎每次都走同一条路。相反,当这个人对路完全陌生,每个路口都可能选左也可能选右,每次走出的路线都不一样——这就是高熵状态,AI非常不确定,它的答案每次都可能大相径庭。
在AI的强化学习训练中,熵是衡量AI探索程度的晴雨表。高熵意味着AI还在积极探索各种可能的答案路径,这对于难题来说是健康的;低熵意味着AI已经倾向于集中在某几个固定的回答上,对于已经基本掌握的简单题来说这是好事,但如果来得太早,就意味着AI过早地锁定了一种思路,放弃了探索其他可能更好的解题方法。
研究团队通过实验观察到了一个非常有趣的现象:在同样一个正在训练的AI模型下,不同类型的题目会触发截然不同的熵水平。具体来说,物理题的平均熵值约为0.49,数学题约为0.60,而指令遵循类任务(比如请用正式语气改写这段线。这就好比同一个学生,做选择题时思路很清晰(低熵),做作文时思绪万千、下笔困难(高熵)——这是完全正常的,因为题目本身的性质就不同。
现在的主流AI训练算法,在处理熵的问题上,大致分为两个层次的方法,但两者都有根本性的局限。
第一类是全局熵控制,就是把整个模型当作一个整体,计算出一个平均熵值,然后统一调整。这就像用全班同学的平均身高来决定食堂餐桌的高度——平均值掩盖了个体差异,高个子要弯腰,矮个子够不着。当AI同时学习物理和指令遵循时,一个任务的熵已经很低了,另一个还很高,取平均之后得到一个中间值,对谁都不合适。
第二类是词元级熵控制,粒度更细,细化到AI生成每一个字词时的不确定性。这虽然比全局方法更精细,但仍然没有解决根本问题:它只看到了单个字词的不确定性,却没有把不同任务类型之间的差异考虑进去。
在这两类方法之外,还有一个更严重的问题几乎被所有人忽视了。现有最流行的AI训练算法之一叫做GRPO(组相对策略优化),它的核心做法是:让AI对同一道题生成多个不同的答案,然后根据这些答案的好坏打分,再把分数标准化——也就是把每道题的分数转换成相对排名,高于平均分的答案得到正向激励,低于平均分的答案得到负向惩罚。
这个标准化操作本来是为了让不同题目的激励信号可以相互比较。但研究团队发现,这个假设在不同题目的熵差异很大时根本不成立。
当AI在某道题上得分的标准差很小(也就是所有答案质量差不多),标准化之后每个答案的激励信号都很弱,AI不会得到太强烈的你做对了或你做错了的信号。而当某道题上所有答案质量差异很大(比如大多数都错、偶尔一个对),正确答案得到的激励信号就会非常强烈,错误答案受到的惩罚则很分散、很轻微。
研究团队推导出了一个精确的数学关系:假设某道题上AI答对的概率是p,那么正确答案得到的激励强度是√((1-p)/p),错误答案受到的惩罚强度是√(p/(1-p))。当p很小(比如p=0.16,也就是只有16%的答案是对的),正确答案的激励强度会爆炸性地增大,而错误答案的惩罚则非常微弱。这就造成了一种极度扭曲的训练信号。
而这种扭曲,恰恰在高熵任务(如指令遵循)上最为严重,因为高熵任务往往对应着更低的正确率。研究团队在真实训练数据上验证了这一点:物理题(低熵)的优势分布接近对称;数学题(中等熵)呈现轻微的右偏斜;而指令遵循任务(高熵)的偏斜值高达2.32、峰度高达4.84,分布极度扭曲——绝大多数答案都只得到很小的负面信号,而极少数正确答案却得到了极端强烈的正向信号。
更糟糕的是,不同任务之间的标准化分数根本不处于同一参考系下。研究团队用两个命题严格证明了这一点:首先,当AI的熵越低,它的选择分布与均匀分布(也就是随机乱选)的偏差越大,这意味着低熵任务的分数分布被策略本身严重扭曲;其次,这种扭曲直接导致标准化之后的激励信号,在低熵任务上系统性地偏离了真实的奖励排名,而在高熵任务上则偏差较小。
这两个效应叠加在一起,创造出了一个令人担忧的循环:低熵任务(AI已经学得比较好的任务)产生了最强烈、最一致的训练梯度,进一步加强了AI在这些任务上的能力;而高熵任务(AI还需要更多探索的任务)产生了弱小、嘈杂的训练信号,学习效率越来越低。随着低熵任务越做越好,它的熵进一步降低,与高熵任务的差距越来越大,高熵任务受到的有效训练越来越少。偏科的剪刀就这样越张越大。
面对这个问题,上海AI实验室的团队提出的方案,核心思路是:不再用一把全局的尺子量所有任务,而是给每一组题目单独量一次体温,然后根据这个体温做出针对性的调整。
具体来说,GEPO的第一步是计算组熵。在GRPO的训练过程中,AI本来就需要对同一道题生成多个答案(通常是16个),GEPO利用这些已有的答案,直接计算这一组答案的平均熵值,把它称为该题目的组熵。这个计算完全免费,不需要额外生成任何答案,因为答案已经在那里了。为了让不同长度的答案之间可以公平比较,还会把总熵值除以平均答案长度,得到每个词的熵。
得到组熵之后,GEPO做的第二步是根据体温施加定制化的干预。具体规则如下:对于组熵很低的题目(AI已经非常确定,说明快要固化了),如果这道题里出现了答对的答案,就把给这个答案的正向激励适当削弱一点,避免AI在已经学得够好的方向上继续过度强化,防止它过早地锁死思路。对于组熵很高的题目(AI还在大量探索,说明这类任务还没学好),如果出现了答错的答案,就把给这个答案的负向惩罚适当减轻一点,避免AI还没来得及探索出好的解题路径,就因为大量的惩罚信号而放弃了探索。
这个干预是不对称的,也就是说,减轻低熵任务的正向激励,和减轻高熵任务的负向惩罚,用的是不同的力度。研究团队发现,低熵任务对干预更敏感:如果在低熵任务上过于激进地惩罚错误答案,会导致AI为了降低每个词的不确定性而快速缩短回答长度——这是一种病态行为,叫做长度崩塌,表现为AI开始给出越来越简短甚至空洞的回答。因此,对低熵任务的干预要温柔,对高熵任务的干预可以更大胆。在实验中,对低熵任务的正向激励缩减系数设为0.5,对高熵任务的负向惩罚缩减系数设为0.2。
第三步是自适应阈值。怎么判断一道题的组熵是低还是高?这个标准不能固定死,因为不同的基础模型、不同的训练阶段,熵的绝对数值差异很大。GEPO的解决方案是:每一轮训练时,计算当前这一批题目的平均熵值和标准差,然后把均值减去0.2个标准差定义为低熵阈值,把均值加上0.3个标准差定义为高熵阈值。组熵低于低熵阈值的题目就触发低熵干预,高于高熵阈值的题目就触发高熵干预,介于两者之间的题目则完全保持原样,不做任何调整。
为了防止这个阈值因为某一批数据的偶然波动而剧烈跳动,GEPO还用了指数移动平均的方式把阈值平滑化——简单理解就是,新计算出的阈值只占10%的权重,历史积累的阈值占90%的权重(平滑系数γ=0.01),这样阈值会随着训练进展缓慢稳定地变化,不会因为某一批特别难或特别简单的题目而急剧波动。
研究团队用两个不同的基础模型来测试GEPO的效果,分别是Intern-S1-mini(一个轻量级多模态推理模型)和Qwen3.5-9B(一个纯文本推理模型)。测试覆盖了十三个不同的基准测试,包括数学竞赛(AIME2025、IMO-Bench)、数学视觉理解(MathVista)、物理推理(Physics、CMPhysBench)、指令遵循(IFBench)、代码生成(LiveCodeBench)、综合知识(MMLU-Pro、GPQA)、多模态理解(MMMU-Pro)、科学推理(SFE、MicroVQA)和图表理解(ChartQAPro)。
对比的基准方法包括:原始的GRPO算法、AEPO(一种基于熵的改进方法)、Clip-Cov和KL-Cov(两种基于概率协方差的覆盖率感知方法)。
在Intern-S1-mini上,GEPO在十三个测试中的七个上取得了最好成绩,综合平均分达到54.2,而GRPO、Clip-Cov、KL-Cov分别是51.5、51.5、51.8。AEPO在数学上表现不错,但在物理和指令遵循上表现欠佳,综合同样是51.8。尤其值得关注的是GEPO在数学竞赛类题目上的表现:AIME25从74.6提升到82.0,IMO-Bench从42.3提升到52.8,GPQA从65.1提升到69.2——这些都是极具挑战性的题目,提升幅度相当显著。
在Qwen3.5-9B上,GEPO的综合平均分达到71.2,高于GRPO的70.7、Clip-Cov的70.9和KL-Cov的69.9。AEPO在这个模型上表现大幅倒退,综合仅67.1,甚至不如原始的GRPO,这说明AEPO的固定熵控制策略对不同模型的适应性很差——当模型的熵特性发生变化时,AEPO的表现会出现明显下滑。GEPO的自适应阈值机制则无需任何调整就能自动适配新模型。
训练过程的稳定性差异同样引人注目。在Qwen3.5-9B的训练过程中,原始GRPO在训练到约170步时发生了灾难性崩溃,AIME25的准确率从约85%骤降至约40%,同时GPQA、MMMU-Pro、MathVista也同步大幅下滑。这是失控的熵增长导致的:没有任务感知的熵调节,模型的输出熵可以无限制地增长,最终产生混乱无意义的输出。AEPO虽然避免了完全崩溃,但表现出持续的震荡,始终无法稳定收敛。KL-Cov在同一模型上于100步后也发生了训练崩溃,推测原因是它使用了固定的熵阈值,无法适应不同任务的需求。GEPO则全程平稳上升,从未出现任何崩塌迹象。
通过观察不同任务的熵随训练步数的演变,可以更清楚地看到GEPO和AEPO的本质区别。AEPO会把所有任务的熵强行拉向相似的水平,抹平了不同任务之间本来应该存在的差异——这就像那位私人教练给所有学员制定了完全相同的训练量,不管你是举重还是瑜伽。GEPO则恰恰相反,它保留了不同任务之间的熵差异:需要更多探索的任务维持在较高的熵水平,而已经基本掌握的任务则自然降低到较低的熵水平,形成了一个健康的、因任务而异的学习节奏。
研究团队还通过消融实验(也就是逐一去掉某个功能,看看成绩有什么变化)验证了GEPO各个组成部分的贡献。
去掉高熵控制(即不再减轻高熵任务的负向惩罚)时,综合成绩从54.2下降到51.3,下降幅度最大。这说明高熵控制是GEPO最关键的组件——如果不保护高熵任务的探索空间,AI会在高熵任务上因为大量惩罚信号而过早放弃探索,物理和AIME25这类需要深度推理的任务受损最严重。
去掉低熵控制(即不再减弱低熵任务的正向激励)时,综合成绩下降到52.6。低熵控制的主要作用是防止AI在已经学好的方向上过度强化,保持探索多样性,主要对IMO-Bench和指令遵循任务的贡献更为突出。
去掉不对称设计(把两个缩减系数设置为相同值)时,综合成绩下降到53.0。这说明区分对待两种熵状态、用不同力度进行干预,确实比一刀切的对称处理更有效。这个发现呼应了之前关于低熵任务对激进干预更敏感的分析:温柔对待低熵任务、大胆对待高熵任务,是符合各自特性的设计。
归根结底,这个研究讲述的是一个关于因材施教的故事。AI在同时学习多种不同性质的任务时,不同任务处于完全不同的学习阶段和探索状态,如果用统一的方式对待它们,强的会越来越强、弱的会越来越弱,最终形成一种高效率但高度偏科的AI。GEPO的方案是给每一组题目独立测量探索体温,然后针对性地调整训练信号——已经学得很扎实的任务,稍微踩一踩油门,别让它抢占太多资源;还需要大量探索的任务,少用点刹车,给它更多空间去寻找正确路径。这种调整既不需要提前告诉AI哪些题是哪类任务,也不需要额外生成任何答案,成本几乎为零。
这对普通用户而言意味着什么?这项研究直接影响的是AI大模型的后训练质量。一个通过GEPO训练的AI,在回答你的数学问题和写作需求时,能做到更均衡:不会因为数学题比较好训练而把大量精力都投入数学,忽视了你的写作或代码需求。更重要的是,训练过程更稳定,意味着研究机构和企业在训练AI时的失败风险降低了,最终产出的模型质量更可靠。
有意深入了解技术细节的读者,可以通过arXiv编号2607.16850检索完整论文,作者来自上海人工智能实验室,论文包含完整的数学推导和实验细节。
A:GRPO通过对同一道题的多个答案进行标准化处理来构建激励信号,但这种标准化隐含着一个前提:不同题目的激励信号在同一参考框架下可以相互比较。然而当不同任务的熵差异很大时,标准化后的分数分布本身就受到策略分布的扭曲,低熵任务产生的激励信号更强烈、更一致,高熵任务产生的信号更弱小、更嘈杂,导致训练资源被低熵任务系统性地抢占。
A:固定阈值在不同基础模型或训练阶段之间无法适应,因为不同模型的熵绝对数值差异很大,同一个固定阈值对某个模型可能合适,对另一个模型可能完全失效。GEPO的阈值基于当前批次的熵均值和标准差动态计算,并通过指数移动平均平滑,能自动跟随训练进展和模型特性调整,无需针对每个模型单独调参。
A:GEPO不需要任何额外的计算开销,也不需要任何任务类型的标注信息。组熵的计算完全基于GRPO训练过程中已有的答案样本,属于零成本的顺手操作。整个方法作为GRPO的轻量扩展,可以直接集成到现有的基于分组的策略优化框架中,不改变采样流程,不增加模型参数。
男子因多次遭到老板训斥、不满工作安排心生怨气,点燃厂房纸壳引发大火,财产损失高达219万余元,残值2.7万元,获刑10年赔偿216万余元
据现代快报,因不满老板日常管理,男子王某一时冲动点燃厂房废纸壳,大火持续燃烧二十余小时,造成两百余万元财产损失。近日,辽宁省营口市中级人民法院公布了该案的二审裁判文书,王某被判有期徒刑十年,赔偿216万余元。
保时捷7月29日公布的上半年业绩显示,其经营利润同比增长33.9%,达到13.5亿欧元,尽管全球交付量下降16.5%。次日,法拉利公布的业绩同样呈现“少卖车、多赚钱”的走势,净利润增长4.7%。同期,奥迪集团旗下兰博基尼和宾利的交付量、经营利润均低于去年同期。
近日,融媒体纪录片《制胜》首次披露国产舰载预警机的试飞过程。据试飞员介绍,“预警机很重很大,弹射的力道必须像手术刀一样精准。短短几秒,速度从零冲至数百公里,人被狠狠按在座椅上。”但前者并未退缩,而是一次次在极限的边缘进行测试。
齐鲁网·闪电新闻8月1日讯 “90后”无业男子和军嫂同居,公然破坏军婚获刑!
由于市场预期美国和伊朗很快举行新一轮谈判,国际原油期货价格美东时间2日下午在新一周交易开始后显著下跌。8月3日亚洲市场开盘,国际油价大幅跳水,布伦特原油期货一度大跌超7%,逼近80美元/桶关口,美国原油期货跌破80美元/桶,截至北京时间16:30左右,美油布油期货跌幅有所收窄。
8月3日,中国奥委会在北京国家奥林匹克体育中心正式发布2026年第20届亚运会中国体育代表团领奖装备。2026年亚运会中国体育代表团领奖装备以“熠熠星辉”为核心设计理念,充分展现中国体育代表团朝气蓬勃、阳光时尚、拼搏向上的精神风貌。
记者在多个社交平台看到,不少博主发帖称,“夏天空调24小时开着不关,更省电”“24小时开空调,比一开一关更省电”。
8月3日,四川观察记者从中国证券监督管理委员会四川监管局官网获悉,四川证监局对个人投资者孙哲元使用AI编造并公开发布关于纯碱生产的虚假文章,且在传播期间交易纯碱期货获利的行为予以惩处,没收其违法所得85028.85元,并处以40万元罚款,合计罚没约48.5万元。
此刻你打开手机上的生鲜App,搜索“鲜活梭子蟹”,页面大概率是空的。8月3日,受台风“白海豚”影响,浙江原定8月5日中午12点出海的四类专项捕捞渔船,出发时间被按下了暂停键。
来源:市场资讯(来源:南湖晚报)今年第13号台风“白海豚”于7月27日生成,8月3日17时其中心位于距离琉球群岛那霸市偏东方向约1890公里的西北太平洋洋面上,中心附近最大风力15级(强台风级)。
2026-08-04 05:10:39
浏览次数: 次
返回列表