Qwen 宣布推出 Qwen 3.8,并称该模型将很快开放权重。按照发布内容,Qwen 3.8 拥有 2.4 万亿参数,目前仍在持续演进。此次公布不仅涉及后续发布计划,也同步开放了一个可立即体验的预览版本,让用户无需等待正式开放权重即可测试模型。
Qwen 在发布信息中将 Qwen 3.8 描述为当前能力较强的模型之一,称其可与领先的前沿 AI 模型相比,并表示其能力仅次于 Fable 5。这些能力定位均来自 Qwen 自身发布内容;材料没有列出基准测试名称、具体成绩、评测方法或与其他模型逐项比较的数据。
Qwen3.8-Max-Preview 已登陆 Alibaba 的 Token Plan、Qoder 和 QoderWork。Token Plan 同时列出了国际与中国两个入口:国际用户可通过 qwencloud.com 的定价页面访问,中国用户可通过 platform.qianwenai.com 的定价页面访问。原始发布内容没有给出开放权重的确切日期。
昨天上午,2026世界人工智能大会“携手助力长三角人工智能产业集群发展论坛”举行。上海、江苏、浙江、安徽经信或工信部门在现场共同发布《2026年度长三角区域重点产品、工艺“一条龙”应用清单》,覆盖技术研发、中试验证、规模量产和示范推广等环节,推动长三角先进制造与人工智能进一步结合。
论坛集中签约了由长三角投资(上海)有限公司牵头的三大人工智能跨域合作平台。第一项是长三角人工智能基础研究服务平台,将联合科研院所和行业协会,围绕算法、算力、高端芯片等底层核心技术开展工作;第二项是长三角人工智能协同投资平台,将联动中央和地方投资平台及金融机构,为硬核科技企业提供耐心资本。
第三项是长三角人工智能应用场景服务平台,联动央企、跨区域创新平台、行业协会,打通AI落地实体经济“最后一公里”。三大平台分别对应底层技术研究、跨区域资本协同和产业应用场景,均采用跨机构、跨区域的合作方式。上海市委常委、常务副市长吴伟出席论坛;报道署名记者吴卫群、见习记者杨爱博。
Princeton University 与 University of Chicago 的研究人员让 ChatGPT、Claude、Gemini 等大语言模型参加一项模拟招聘游戏,研究模型是否会从经历中形成刻板印象。模型被设定为受虚构城市市长聘请的顾问,需要为医生、律师、儿童照护员和清洁工等20种工作挑选人员。候选人来自 Tufa、Aima、Reku 和 Weki 四个虚构族群;每轮各有一名候选人,录用后模型会得知其工作是否成功,并在40轮中尽量提高成功录用次数。实际上,所有候选人在任何岗位上的成功概率完全相同。
模型很快依据早期、偶然的结果,把不同族群分配到不同工作。例如得知一名 Aima 医生失败后,模型便减少录用所有 Aima 担任医生,转而让他们从事模型归类为温暖度与能力要求较低的清洁工作。在最高为2分、代表每个族群都被完全限制在各自职业范围内的隔离量表上,原始心理学研究的人类参与者得分为0.84,模型得分约高65%;OpenAI 推理模型 o3 达到1.83,接近上限。较新的高推理能力模型,包括 o3 和 DeepSeek R1,表现出更强偏见。论文共同作者、Princeton University 博士生 Ryan Liu 说,LLM 很倾向于从有限数据中概括规律,而数学、编程和科学训练对少量样本归纳能力的奖励,也可能使模型过早确定判断。论文于7月在首尔举行的 ICML 发表。
仅要求模型保持公平,并未显著改变其行为;为多元化招聘设置额外奖励后,偏见则明显下降。在另一项加拿大城市安置实验中,提供年龄、教育程度等与适应能力相关的个人信息,会减少模型按族群隔离人员的倾向;提供发色、纹身形状等无关信息时,模型大多重新按族群分类。Cornell University 计算机科学家 Angelina Wang 认为,聊天机器人的记忆和个性化功能可能使其过度依赖既往行为,但简单减少记忆也不能满足用户需求。现实招聘不会像实验一样立即反馈录用成败,但企业逐渐使用 LLM 筛选简历、开展面试,迟来的反馈仍可能被模型过度概括。OpenAI 和 Anthropic 未回应置评请求。
Moonshot AI表示,Kimi K3获得的需求远超预期,过去48小时的使用量已接近现有算力容量上限。为保障现有订阅用户的使用体验,公司暂时停止接受新订阅,并优先向当前会员分配计算资源;已有订阅用户不受影响。
公司正在增加容量,之后将分批重新开放订阅名额。会员体系也将拆分为两个用途更集中的方案:Kimi Membership面向Kimi Web、App和Work,Kimi Code Membership面向编程工作流,以便按使用场景更精确地匹配算力并维持服务稳定。
看英文原文 →法国和意大利三所大学的研究人员发现,提供AI建议后,参与者回答“不知道”的比例从44%降至3%,准确率从27%降至9%,自信比例却从30%升至76%。研究使用Step 3.5 Flash回答其通常容易出错的电影视觉细节题,部分原本能独立答对的人采纳AI答案后反而答错。
研究由University of Milano-Bicocca的Valerio Capraro、École Normale Supérieure的Chiara Marcoccia和Sapienza University of Rome的Walter Quattrociocchi共同完成。加入金钱奖励后,承认不知道的比例仅回升至8%,准确率升至16%,仍低于无AI时的44%和27%。Capraro称,承认自身知识边界的能力对人类十分重要,并特别担忧尚在形成批判性思维能力的儿童。
看英文原文 →一名安全研究人员称,其使用GPT5.6 Sol Ultra和25美元成本,在最新版稳定WordPress源码中发现一条从未认证状态通向远程代码执行的漏洞链;文中称漏洞经纪人为一项WordPress远程代码执行漏洞支付50万美元。团队还提供wp2shell.com,供WordPress运营者检查实例是否易受影响。
研究人员把OpenAI公开的一份提示词改写为安全审计任务,要求模型最多同时使用4个代理、持续至少6小时,从输入解析、文件上传、序列化、缓存和底层依赖等多条路线检查代码。他在源码副本中删除.git目录,并禁止模型借助更新记录或补丁差异寻找线索。团队推迟发布以留出周末升级时间,其间Calif和Hacktron独立复现了完整漏洞链。
看英文原文 →一则7月20日发布的帖子称,Claude Fable给出了雅可比猜想的反例:一个从复三维空间映射到自身的三元多项式映射,其雅可比行列式恒为-2,但并非一一对应。帖子因此声称该猜想为假,并列出了完整的三个坐标多项式。
帖中给出的三个不同输入点为(0,0,-1/4)、(1,-3/2,13/2)和(-1,3/2,13/2),它们都被映射到同一点(-1/4,0,0)。发帖者附上WolframAlpha链接,用于计算该映射的雅可比行列式,并核对其中两个输入点的代入结果。
看英文原文 →研究人员提出手机GUI智能体安全框架SeerGuard,在操作执行前进行指令级筛查和动作级风险评估。该框架结合当前界面状态分析智能体拟执行的动作,预测可能产生的结果,以便在错误操作造成不可逆后果前识别风险,补足现有安全机制以事后响应为主的局限。
SeerGuard通过多任务学习构建统一的安全增强世界模型SAWM,将下一状态的语义预测与安全风险评估整合在一起。实验显示,该框架可适配多种手机GUI智能体;在Qwen3-VL-8B-Instruct上,当ω=0.8时,安全效用得分由0.191升至0.596,当α=0.8时,风险成本得分由0.347降至0.130。
看英文原文 →研究人员推出智能体强化学习框架ToolVerse,用于构建大规模可执行训练环境,并训练模型完成需要连续调用工具的长程推理任务。该框架针对LLM智能体在规模庞大、类型多样且动态变化的真实环境中稳定性不足的问题,覆盖近400个现实世界Model Context Protocols (MCPs),包含约4500项工具。
ToolVerse依据工具依赖图设计任务,并通过Dynamic Unlocking Sampling Algorithm生成长程任务,形成GUST数据集。为缓解长程强化学习中的信用分配问题,研究还提出细粒度的Turn-Aware Relative Advantage算法;多个智能体基准上的实验显示,经该框架训练后,模型的长程工具使用能力得到提升,并能在动态环境中完成推理。
看英文原文 →研究人员发布DrawingVQA,用于评估多模态大语言模型理解真实施工图的能力,并称其为首个面向这一场景的基准。施工图同时包含抽象几何、符号标记、表格、注释及专业文字,与自然图像或示意性户型图不同;该基准收录33张“Issued for Construction”图纸和92组专家整理的问答。
题目覆盖感知理解、语境解释和领域专家推理三个深度。研究还建立双重分类框架,从七个建筑工程维度和四个多模态模型能力维度联合分析表现,将工程工作流程对应到AI推理能力。对多款先进多模态大语言模型的评测显示,模型与专家之间仍有明显差距,且差距在较高推理深度的题目中更突出。
看英文原文 →研究人员提出面向分类模型的反蒸馏防御方法ADS-C,针对攻击者查询专有分类器的预测接口、取得概率向量并训练替代模型的做法。研究发现,直接把原用于大语言模型的反蒸馏采样移植到分类任务,会受教师模型逐样本置信度间隔影响:低于阈值时不起作用,超过阈值后则会更快损害教师模型。
ADS-C在可闭式计算的逐样本间隔预算内加入扰动,并保证接口返回的每个top-1预测不变,因此防御前后教师模型准确率相同。其蒸馏学生模型在CIFAR-100、CIFAR-10和Tiny-ImageNet上分别下降17.4、29.6和13.3个百分点;未修改的原防御若达到相同效果,教师准确率会分别损失27.5、32.9和22.2个百分点。
看英文原文 →论文提出 Looped Latent Attention(LLA),用于压缩权重共享循环 Transformer 的 K/V 缓存。这类模型虽通过重复使用同一模块减少参数,解码时仍需为每次循环分别保存缓存。研究发现,同一 token、层和注意力头的 K/V 向量在循环间呈短程低秩轨迹,因此可存储紧凑的 K、V 潜变量,仅在注意力读取时重建对应循环的向量。
LLA 以教师模型激活值的 SVD 初始化,并通过 KL 与注意力输出蒸馏优化;LLA-2D 还将多个注意力头合并至同一潜变量。相同缓存预算下,LLA 优于跨头 MLA、跨层共享、KV 量化及仅复用最后循环等方案。在 Huginn-3.5B 上,SVD 编解码器压缩至 32 倍仍接近无损;单张 H200 上,Ouro-1.4B 在 4k 上下文、21.3 倍压缩时,批容量由 32 条增至 768 条。经学生生成前缀的在策略优化后,4 倍压缩下 MATH-500 得分由 0.43 升至 0.66。
看英文原文 →从 65 条资讯中筛选
今日全部信源这一期是从下面这些一手英文信源里,筛掉噪音后留下的。