中国科技公司 Alibaba 发布 Qwen3.8-Max,并称这是其迄今规模最大、能力最强的 AI 模型。Alibaba 在周一发布的博客文章中表示,将让用户广泛使用这款模型。此次正式发布并非突然出现:公司已在上个月预告 Qwen3.8-Max,并提前披露了对其性能水平的判断。
据 Alibaba 的博客文章,公司认为 Qwen3.8-Max 的表现可与美国前沿实验室 Anthropic 和 OpenAI 的领先系统竞争,同时也能与中国公司的模型相比较,材料点名的国内对手包括 Moonshot AI 的 Kimi K3。Alibaba 上月预告模型时还称,其能力“仅次于 Fable 5”;材料将 Fable 5 描述为 Anthropic 的旗舰模型。
Qwen3.8-Max 以开放形式发布,为市场增加了又一款来自中国、被开发者宣称具备较高能力的 AI 模型。材料同时提到,这次发布发生在硅谷与华盛顿围绕 AI 的多条战线关系紧张之际,但节选没有列出相关争议的具体内容。
乌克兰军方过去使用装有爆炸载荷的 Shrike 无人机攻击俄方装备,材料称其已经摧毁多辆地面装甲车辆,甚至击中空中的军用直升机。每架 Shrike 的价格约为 400 美元。如今,数以千计的这类低价无人机将加装 AI 系统,使其能够自主追踪移动目标并向目标飞行。
这项交易金额为 1 亿美元,计划为 5 万架乌克兰无人机配备由美国公司 Auterion 开发的 AI 能力。7 月中旬,乌克兰军方开始接收首批升级版 Shrike;无人机由乌克兰公司 SkyFall 制造,所用自主飞行硬件和软件则来自 Auterion。两家公司计划在未来数月内交付 5 万架安装 Skynode S 打击套件的无人机。
Auterion 联合创始人兼 CEO Lorenz Meier 对 Ars 表示,操作员仍会先以第一人称视角手动驾驶 Shrike 进入战场区域,并指定最远半英里外的目标。完成指定后,操作员可以切换模式,让无人机进入“发射后不管”的末段制导状态;此后,系统会自主追踪并飞向移动目标。
今年夏季早些时候,近 16 万名申请者参加了墨西哥最大大学 UNAM 的入学考试。这是该校首次把考试完全改为远程进行:考试从 5 月下旬持续到 6 月上旬,历时数周,考生使用限制其他操作的“锁定”浏览器,并通过带有 AI 功能的摄像头监考软件接受监督。
成绩公布后,分布与往年出现明显差异,尤其集中在高分段。UNAM 的试卷共有 120 道题;2021 年至 2025 年,取得 100 分或以上的考生平均占 3.5%,今年这一比例升至 16.3%。按比例计算,今年的高分考生占比约为此前水平的 4.7 倍,与摘要所称的约 5 倍相符。
在这场首次全面远程举行的入学考试出现异常后,5.8 万名学生被要求重新参加考试。材料明确给出了考试规模、监考方式和高分比例变化,但节选没有列出导致异常成绩的具体技术故障,也没有把成绩变化直接归因于某一种行为。
Superblocks与AWS签署多年联合营销协议,允许AWS企业客户把其氛围编程工具部署在自身私有云中。由此创建的应用不会把数据发送给外部模型提供商或数据库,而是在客户账户内启用Amazon Aurora,并接入Amazon Bedrock,纳入企业IT部门的安全、审计、加密和网络控制。
Superblocks联合创始人兼CEO Brad Menezes告诉TechCrunch,客户数据不会离开其AWS账户。AWS还将协助向企业销售该产品。Superblocks目前有50名员工,截至2025年5月公布A轮融资时累计融资6000万美元。Menezes称,企业正从指定单一模型转向多模型方案;上月经Vercel AI gateway路由的流量中,开放模型占29%。
看英文原文 →Design Arena背后的公司Intelligence宣布完成790万美元种子轮融资,由Index Ventures领投,Conviction、A*、Valkyrie等参投。该产品源于创始团队对AI生成游戏进行人工评价的尝试,目前在全球拥有530万用户,通过让用户连续比较“A与B”的网站、图像等视觉内容,为模型提供人类偏好数据。
联合创始人Grace Li说,公司在推出产品约一周后便与一家前沿实验室达成首笔重要交易,目前年经常性收入为6000万美元。用户登录后才能取得生成结果,因此平台也能追踪不同地区及不同时期的审美变化。类似的人类评估公司LM Arena于1月完成1.5亿美元A轮融资;Yupp则在融资3300万美元、用户超过130万后,于今年早些时候停止运营。
看英文原文 →Apple在7月发布的iOS 27消费者测试版中上线新版Siri。它能够结合用户个人资料和通用知识回答问题,并从iPhone中的照片、邮件、联系人、短信和日历项目里查找相关信息。用户可与其连续对话、调整语音表达和节奏,也可通过文字或首次推出的独立应用使用,并引用过去的对话。
新版Siri可以从照片中识别驾照号码或截图中的二维码,还能启动网站和应用,执行导航、播放音乐、编辑照片、起草邮件及播放有声书等操作。用户也可在相机取景器中询问现实物体,或让其协助分摊餐费。这些功能采用Apple与Google合作取得的Gemini模型技术,用于训练和改进Apple Foundation Models;正式版iOS 27预计于9月发布。
看英文原文 →据CNBC报告,在截至3月31日的一年里,按支出金额计算,ChatGPT是美国国会最主要的付费AI工具。众议院办公室、委员会及机构账户通过798笔交易向OpenAI支付约100580美元,占相关AI工具支出的约90%;同期可识别的AI支出总额至少为113740美元。
Anthropic的Claude以37笔交易、合计13160美元位居第二。民主党办公室的AI采购额为54165美元,约为共和党办公室15782美元的三倍。统计不包括免费账户产生的使用量,也未计入捆绑在其他软件合同中的AI服务。国会工作人员使用这些工具撰写备忘录、概括和分析法案、回复选民、准备听证材料、整理政策研究及起草社交媒体内容。
看英文原文 →前Salesforce高管Efrat Rapoport与Ohad Hen、Barak Goldstein、Idan Tsitiat共同创办的June于周一结束隐匿运营。其平台扫描企业现有系统,梳理业务流程和瓶颈,再生成由智能体驱动的优化流程及实施路线,指导团队清理重复字段、连接数据源,并在企业内部逐项构建。
June获得2000万美元种子前融资,由Marc Benioff旗下Time Ventures领投,Michael Dell、Aaron Levie和George Kurtz等参与。四名创始人此前创办Bonobo AI,该公司2017年推出语音转文字服务,两年后被Salesforce收购。美国抵押贷款机构CMG已使用June处理Claude Code与Salesforce的集成障碍。
看英文原文 →一项研究审计R-Judge、InjecAgent、AgentHarm和AgentDojo四项智能体安全基准,按各自官方实现和作者提供的评分器测试最多22个模型,并以统一协议测量MMLU和GPQA,组成能力指标。研究认为,这些基准测量的行为不同,不能将分数不加区分地统称为智能体安全。
在采用F1分数的二元轨迹判断中,始终给出肯定判断的策略在R-Judge可得0.690分,高于21个实际进行区分的模型中的5个。三个覆盖面较广的基准对同一组18个模型给出不同排序;能力与任务成功相关系数为+0.60,与失调安全为-0.44。AgentHarm在控制能力后与三模板越狱安全的相关系数为+0.72,但两者均衡量有害服从。
看英文原文 →一篇Perspective文章讨论LLM对自行就诊、病情尚未分化患者进行自主分诊的风险,场景中很少或没有临床医生参与。文章指出,LLM虽已能通过医学执照考试,并在筛选病例中展现诊断推理能力,但现有证据尚不能证明其可安全承担自主分诊;问题主要不在医学知识,而在临床评估是否完整可靠。
临床分诊需要在错误代价不对称的情况下连续决策,一次灾难性漏诊可能重于多次误报,关键征兆也可能尚未由患者主动提供。病史不完整时,LLM可能未能扩大鉴别诊断、追问缺失的危险信号、降低升级处置门槛,或在高伤害诊断尚未排除时提高警觉。现有评估多采用信息完整、经过整理且设置置信门槛的模拟病例,可能难以暴露这些问题。
看英文原文 →一项研究针对解耦式LLM推理中的数据传输问题设计拓扑感知编排器:当预填充与解码位于不同GPU池时,系统需转移KV缓存,70B模型每次请求约产生2.6GB数据,生产规模下总流量超过100GB/s。现有DistServe、Splitwise和Mooncake采用统一RDMA,未区分GPU之间的物理连接。
不同连接的带宽相差72倍:同一域内NVLink为900GB/s,跨节点InfiniBand为50GB/s,跨数据中心TCP为12.5GB/s。该方案启动时识别互连层级,并结合逐层流水传输、面向Mixture-of-Experts的NVLink域放置及CXL 3.0共享溢出层;分析预计传输延迟较统一RDMA降低3至18倍,逐层传输可用计算隐藏60%至85%的延迟。
看英文原文 →一个新建GitHub仓库近期集中发布多份SQLite漏洞通告,NVD迅速将其标为严重漏洞,CISA的ADP也给出相同判断。JFrog安全研究人员核查后发现,多项描述引用了目标版本中不存在的函数、无关代码或错误行号,测试载荷也未触发崩溃。
研究人员在隔离Docker环境编译SQLite 3.41.0、3.51.2和3.51.3,并以AddressSanitizer执行通告中的SQL。多项PoC仅产生语法或JSON解析错误,另有通告声称3.51.3修复expr.c,但版本差异显示该文件没有变化。CVE-2026-51302的Red Hat评分也由10.0下调至7.6。
看英文原文 →一名开发者分享其个人项目工作流:让编程助手在聊天中生成代码,再由自己逐行输入编辑器,而不是允许助手直接修改项目。他认为,一次生成完整功能会使自己难以理解代码,审阅数百行可能过度防御、注释不佳或存在细微错误的AI代码同样负担较重。
作者估计,这种方式使开发速度约为不用LLM时的2倍,而非部分人追求的10倍。手动输入让他能够建立代码库的结构认知,在遇到不熟悉的API或算法时停下来查阅,并在录入过程中发现幻觉或设计问题、重构代码及补充注释。他已采用该流程数月,并计划继续使用。
看英文原文 →一篇分析指出,AI虽然能够加快编码,但工程师的大量时间用于理解需求、设计系统、协作和拆解问题,因此生产功能的整体交付速度并不会按编码速度同比提升。作者还称,AI生成的产品需求文档或Linear工单有时过于详细,提取重点反而比阅读人工撰写的材料更慢。
按文中的假设,若AI将编码速度提高至3倍,资深开发者每天仅节省1.25小时,整体效率约提高15%;类似岗位的初级开发者每天可节省2小时,效率约提高25%。文中将差异归因于初级开发者花在编码上的时间更多,而资深人员更多时间用于推理系统、处理模糊需求和共同解决复杂问题。
看英文原文 →一篇7月30日提交的论文提出名为“Locksmith Loop”的代理式测试合成方法,用于验证COBOL程序迁移至Java后的功能一致性。该方法分别为COBOL源程序和生成的Java程序配置模拟环境,在普通硬件上脱离大型机运行,再搜索能够进入不同程序分支的输入并进行保持一致性的变异。
研究覆盖三个COBOL至Java案例,包括两个开源程序和一个内部、接近生产环境的程序,代码规模为430至4114行。该方法在两个开源程序上达到接近完整的覆盖率,在内部程序上取得91.90%的分支覆盖率;所有被接受的测试案例中,生成的Java均通过确定性一致性检查,与COBOL参考程序结果相符。
看英文原文 →OpenAI下一代主要模型家族Astra的一个内部版本,完成了10项长期未解决问题的证明,涉及数学、量子复杂性和理论计算机科学。相关信息将其描述为面向科学推理的一项重要进展。
公布的成果还包括计算永久量的新电路下界。材料同时提到,GPT-5.6已支持多项数学与科学工作,但未列出这10项问题的完整名称、证明内容及验证情况。
看英文原文 →从 77 条资讯中筛选
今日全部信源这一期是从下面这些一手英文信源里,筛掉噪音后留下的。