首页 > 调查 > 正文

谍影重重

Qwen3.8,登顶英伟达榜单!_我的网站

五星酒店潜规则

A |     Kenny 报道 警方数据显示,汉密尔顿街头最近一年有2200多辆汽车被盗,这相当于每个月有190辆车被盗,每天被盗6辆。    智东西(公众号:zhidxcom)     作者 | 程茜     编辑 | 云鹏          智东西7月22日报道,昨日,阿里千问最新发布的Qwen3.8预览版模型在英伟达评估AI进行算子优化的榜单上登顶,排名超过腾讯混元、人类开发者、Cursor。         2023年3月1日至今年2月29日,汉密尔顿累计被偷盗的汽车为2289辆。其中丰田有560辆,马自达有367辆,日产汽车有349辆。警方事后追回的被盗车辆为1754辆。         榜单中SOL得分指的是GPU的峰值算力与HBM带宽共同决定的理论性能极限。         Advertise with us          偷车发生最频繁的街道是Ulster St和Victoria St。模型这一分数越接近1,代表其生成和优化GPU算子能力越接近理论极限,可以在无需人类标注的情况下,通过与真实硬件环境的交互,自主产生训练信号、评估自身输出质量并持续改进算子。         汉密尔顿当地居民Patricia Goh说她对这些数字并不感到惊讶。

B |          这一榜单中排名第二的是腾讯混元Hyra、排名第四的是人类开发者Amir M. Mir、排名第六的是美国AI创企doubleAI的全自动GPU内核生成智能体系统、排名第十的是AI编程独角兽Cursor,其他项目暂未找到公开打榜记录。

C |          “在搬到汉密尔顿之前,我的车从未被偷过,”Goh对记者说。         SOL-ExecBench榜单是今年3月,英伟达推出的GPU CUDA Kernel内核优化基准评测套件,面向Blackwell B200架构专门用来评测AI智能体、编译器、自动内核生成工具写出的GPU算子性能。         “我在但尼丁、惠灵顿和尼尔森都住过,没遇到过任何问题。”          等她搬到了汉密尔顿,过第一个圣诞节的前夕,就在她上班的时候,她的汽车在光天化日下被偷走了。         警方后来发现Goh的丰田车被遗弃在一个死胡同里,发现它时引擎还在转。

D | Qwen3.8登顶的FlashInfer-Bench子集,就是专门用于测试和优化大语言模型推理系统中的GPU算子。         7月19日,阿里千问大模型团队宣布将很快发布并开源Qwen3.8。         “车里留下了一个圣诞老人包,但他们把里面的东西都扔了。该模型参数2.4T,可能是除了Fable 5外最强大的模型。昨晚,Qwen3.8-Max-Preview更新,前端(WebDev)表现更好。”          Goh将车送修两个月后,同一辆车在不同地点再次被偷。她说小偷有尝试打火发动,但是没有成功,结果把装置弄坏了。

E |          一、从124个模型中提取,共235项CUDA内核优化任务          随着AI智能体生成与优化GPU内核的能力持续增强,现有基准评测的一大局限暴露,其只看重相对软件基线的加速比,而非内核执行方案本身贴近硬件最优效率的程度。而在现代数据中心中,未能充分利用硬件的kernel意味着算力与能源的双重浪费。郁闷的她不得不再次把车拿去送修。

F |          这让她产生了心理阴影,于是把旧车卖给了朋友,自己重新买了一辆带无匙启动功能的汽车。         基于此,英伟达提出了SOL-ExecBench基准套件。她说这是她把车停在街上唯一感到安全的方式。这一套件共有235项CUDA内核优化任务,提取自124个商用及前沿人工智能模型,覆盖大语言模型、扩散模型、计算机视觉、音频、视频以及混合架构,目标硬件为英伟达Blackwell系列GPU,涵盖BF16、FP8、NVFP4精度下的前向与反向计算负载。

G |          其实偷车并不是汉密尔顿独有的现象。2023年全国有30109起机动车及其零部件被盗事,“非法使用机动车”的案件达到50791起。         新西兰警方表示,车主需要保持警惕,并始终确保车辆已经锁好和拔下钥匙。

H |          与以往基于软件性能来进行评估标准相比,SOL-ExecBench的评估目标有所不同。

I | 其通过“Speed-of-Light(SOL)”界限来评估内核性能,即由GPU的峰值算力与HBM带宽共同决定的理论性能极限。         英伟达开发的SOLAR工具能够从FLOP数量、字节数、GPU峰值吞吐量以及带宽等方面,分析出这些基于硬件的SOL界限,然后将这些界限与预先定义的评分基准相结合,从而得出SOL评分。         警方声明称:“如果可能,请将车辆停放在安全区域,最好是远离街道,选择车库或光线充足的区域。”          “请记住移除车上所有贵重物品,包括重要文件,并将它们放在看不见的地方。         具体来说,评分为0.5表示与基准值相当,评分为1.0表示达到了硬件上的SOL界限。因此,这个评分不仅反映了相对于基准值的改进程度,还体现了与最大可实现硬件性能相比所剩余的优化空间。物品摆放显眼的话可能对罪犯产生更大吸引力。

J | ”          警方还建议在停车处安装闭路摄像头,以及修剪住家附近的树木增加能见度等。         “警方严肃对待这一犯罪行为,并鼓励人们随时向警方举报任何被盗车辆或可疑行为。”          相关阅读:          6人开着三辆车撞击酒铺抢劫未遂,这座城市偷车猖獗          周末生日派对变惨烈角斗场:百人群殴二死多伤!          6名青少年开着偷来的车撞向多辆汽车,已被奥克兰警方拘捕          夜间奥克兰的快餐店和民宅遭砸抢,居民被袭击,一人受伤          又一起!5人持械抢劫奥克兰一家加油站,员工被威胁          打击犯罪:奥克兰警方连夜出动,突击检查94个加油站          奥克兰一家餐厅被盗,损失达数万纽币,老板深受打击          两名男子大白天持械抢劫奥克兰酒铺,抡起斧头砍店员          深夜开着偷来的汽车高速逃逸,五名奥克兰青少年被拘留          奥克兰昂贵自行车被盗,提供监控照片及GPS数据后警方拒绝调查          奥克兰一购物中心内珠宝店被暴力打劫,一名20岁男子逃离现场后被逮捕          奥克兰夜间发生暴力入室抢劫案,4名持枪罪犯逃窜100公里后在北地被捕          太猖獗!四名劫匪持斧头抢劫奥克兰加油站,员工差点爆头而亡          四名蒙面罪犯手持锤子袭击奥克兰加油站店员,行业组织恳求政府紧急行动          奥克兰高峰时段发生激烈追逐:逃逸车辆逆行险象环生,两人被捕          奥克兰北岸大超市清晨被抢:警方出动直升机和警犬队追捕,4人被拘          700棵蓝莓树被偷摘,价值5万纽币的青铜雕塑被破坏          奥克兰发生激烈群殴事件,武装警察包围了一栋房屋,一男子被捕          注:本文为编译/原创,欢迎转发分享;但严禁复制等未经授权的非法使用。违反上述声明者,本网将追究其相关法律责任。         为保证评分结果的可靠性和可重复性,SOL-ExecBench还包含一个沙盒评估工具。此外基于其开发的智能优化算法,可以在相同的评估协议下改进提供的PyTorch参考实现,这种优化算法可以识别出那些试图操纵评估器的行为,即试图绕过评估机制以获得更快的运算结果。使用授权请联系[email protected]。         chineseherald.co.nz All Rights Reserved 版权所有          (责编:Sophie)          相关内容                突发!韩裔部长,被逐出内阁!           奥克兰公交车又发生流血事件 6名青少年持刀袭击2少女           搞中国特色?新西兰考虑对现有高速公路收费......           独家对话新西兰前总理:现在不应该减税,外交必须中立           今晨奥克兰CBD有人被威胁并抢劫 事发繁忙街道           新西兰北岛又发生地震 逾千人有震感           33岁男子屁股脓肿呼叫急救,被拒后暴走劫救护车!律师:他还只是个孩子......           新西兰总理:尊重“一个中国”原则,不会访问台湾。

K |          此次Qwen3.8拿下第一的是FlashInfer-Bench子集,专门用于测试和优化大语言模型推理系统中的GPU算子。         该子集包含26个来源于Llama-3.1-8B、Qwen3-30B-A3B、DeepSeek-V3/R1的问题。

L |          该子集覆盖的精度格式为BF16与FP8,每个问题提供7-48个动态形状的输入配置,覆盖真实生产场景,典型任务包括融合注意力(Fused Attention)、FP8 MoE和RMSNorm等推理关键算子。         根据官方披露,该测试套件中所有提交内容均在真实NVIDIA B200 GPU上隔离执行,GPU时钟锁定在1500 MHz以保证可复现性。         二、榜单排名靠前,意味模型具备闭环自我改进潜力          Kernel优化是少数几个可以提供清晰、客观、可量化反馈信号的真实工程任务之一:          反馈明确:运行时间、吞吐量、带宽利用率可以精确测量;     标准客观:距离硬件理论极限还有多远,没有歧义;     迭代自然:每一轮优化都可以作为下一轮的起点。         这意味着模型可以在无需人类标注的情况下,通过与真实硬件环境的交互,自主产生训练信号、评估自身输出质量并持续改进。         在SOL-ExecBench FlashInfer-Bench子集上表现靠前,就意味着模型在下面几项能力上具有优势:          长程因果推理:优化决策之间存在复杂依赖链,局部改动会影响全局性能,模型需要跨越长上下文进行一致性推理。    工具使用与环境交互中的策略规划:现实世界智能体任务面对多轮工具调用,模型需要根据每次执行反馈动态调整策略,而非机械执行预设步骤。    稀疏反馈下的探索能力:性能提升往往不是线性的,模型需要在大量“看似合理但实际无效”的方向中识别真正有价值的优化路径。    系统级抽象与具体实现之间的双向翻译:从高层算法语义映射到底层硬件指令,再从硬件反馈反推优化方向,这种双向能力在科学计算、编译器设计、芯片设计等领域均有直接迁移价值。

M |          这也意味着,能在SOL-ExecBench上持续进化的模型,具备在客观物理约束下进行闭环自我改进的能力。         三、训练侧搭建真实GPU环境,推理侧引入阿里智能体框架          智东西从千问团队获悉,在训练、推理方面,千问团队均针对Kernel Self-Evolving进行了优化。         首先在训练侧,为了让模型真正具备kernel优化能力,而非仅仅学习表面的代码模式,其构建了一套基于真实GPU环境的大规模强化学习体系。

N |          1、研究人员搭建了基于沙盒的真实GPU训练环境:          为模型提供丰富的硬件文档与可交互的Workspace,使模型能够通过真实编译、执行与性能测量获取来自硬件的奖励信号,而非依赖代理指标或模拟器。这可以确保每一个训练信号都有真实的物理意义。         2、真实Kernel仓库作为训练数据          研究人员系统性收集了大规模真实的工程级kernel优化代码,以这些真实世界的kernel作为训练query。相比合成数据,真实反馈覆盖了更广泛的优化模式、硬件适配策略与工程取舍,为模型提供了更接近生产场景的学习信号。         3、RL基础设施的针对性优化          Kernel优化任务的一个显著特点是需要超长的工具调用序列,单次优化过程可能涉及数十乃至数百轮的编译-执行-分析循环。         为此,研究人员对强化学习训练基础设施进行了专项优化,使其能够高效支持超长多轮工具调用的训练,从而让模型真正学会跨越长序列的持续优化策略。         在推理侧,研究人员使用阿里巴巴Atrex Kernel Agent框架来承载算子优化的完整分析迭代流程与经验沉淀机制。         ▲阿里巴巴Atrex Kernel Agent框架和工作流(图源:GitHub)          在SOL-ExecBench FlashInfer-Bench子集的评测中,该模型完成了平均29354轮工具调用的持续迭代,在每一轮循环中对kernel实现进行编译、执行、性能分析与策略调整,将性能逐步推向硬件理论极限。         这意味着,模型在数万轮的迭代过程中可以保持方向一致性、持续产出有效优化、不陷入局部震荡,正是长程持续优化能力区别于普通代码生成能力的核心所在。         结语:从手写算子到AI生成、调优,Qwen3.8刷新自动化算子生成能力上限          Qwen3.8此次登顶,意味着其有能力承担底层算力优化的复杂工程任务,并进一步压缩人工介入算子开发的工作环节,其能直接对接真实硬件环境采集运行反馈,形成从算子生成到性能调优的自动化闭环。         自动化GPU算子生成赛道的长期竞争,未来或取决于大模型理解硬件架构、推演访存瓶颈、自主迭代调参的综合智能水平。

o | 长远来看,伴随大模型能力升级,模型侧与编译层在算力优化方面将形成持续双向反馈,硬件规格、算子实现、模型架构三者协同演进可能会成为常态。

Current article:http://iyx.ningshunsaotuiqiao.shop/news/20260826_89788.html

Published on:13:42:53


[责任编辑: 徒陵]

评论

 
[ 【第762期·放假通知】长沙市开福区水映加州幼儿园2025年元旦放假通知 ]  [ 人民银行安徽省分行聚焦“资金链”精准治理,多维度推进反诈工作 ]  [ Israel in Need of Political Reform to Make Stable Government Possible, Experts Say ]  [ Intel公布酷睿i9-13900K处理器性能细节 AMD Zen 4旗舰7950X败了 ]  [ 官方:2025年WTT总决赛将在中国香港进行,总奖金池130万美元 ]  [ 税费优惠政策给力 文旅企业生机焕发 ]

 
  • 关于我们 | 我的网站 版权所有

    Copyright ? 2019 我的网站 All Rights Reserved