提示词注入通常是一种攻击手段:攻击者把恶意命令嵌入电子邮件、日历邀请等内容,诱使大语言模型读取并执行。只要命令措辞得当,模型就可能违背用户本意,外泄敏感数据或采取其他有害行动。Tracebit 的研究人员则把同一种机制用于防御,并将这种做法称为“上下文轰炸”:在攻击型 AI 代理可能读取的位置预先放置专门设计的指令,使其在造成损害前停止运行。
Tracebit 研究人员周一公布的结果显示,把提示词注入与 Amazon Web Services 环境中的密码、加密密钥及其他机密信息放在一起,往往就足以中止由 AI 黑客代理实施的攻击。其关键不是让代理接受一条普通的停止命令,而是引导负责攻击的大语言模型尝试执行一项被自身安全规则禁止的操作。
这些禁令来自 AI 开发者设置的护栏,即用于阻止模型采取有害行动的安全限制。当攻击代理读取防御者布置的提示词并触碰护栏后,大语言模型会以停止运行为响应,从而令依赖该模型继续执行步骤的攻击流程中断。
University of Chicago 社会学家 James Evans 领导的研究分析了超过 4000 万篇学术论文,结论是:在研究中采用 AI 的科学家会发表更多论文、获得更多引用,并更早成为团队负责人;但从科学整体看,AI 使用密集的研究覆盖主题更少,更集中于相同的热门问题,不同研究之间形成的后续互动也更弱。Evans 将其概括为个人激励与科学整体之间的冲突。相关成果于 1 月 14 日发表于《Nature》。
Evans 团队与 Beijing National Research Center for Information Science and Technology 的合作者训练了一个自然语言处理模型,用于识别六个自然科学领域中的 AI 辅助研究。数据集包含 1980年至2025年发表的 4130 万篇英文论文,涵盖生物、化学、物理、医学、材料科学和地质学;计算机科学和数学等以开发 AI 方法为重点的领域被排除。研究人员比较了约 31.1 万篇使用神经网络、大语言模型等 AI 技术的论文与数百万篇未采用 AI 的论文,并追踪作者职业发展、论文关注度以及各领域知识分布。结果显示,AI 使用者平均发表的论文数量是非使用者的 3 倍,引用量接近 5 倍,成为团队负责人的时间提前一至两年。
研究人员把论文映射到高维“知识空间”后发现,AI 密集型研究占据的知识范围更小,更紧密地聚集在流行且数据丰富的问题周围,研究之间的后续连接也较弱。这一模式贯穿早期机器学习、深度学习兴起和生成式 AI 阶段,Evans 称其仍在加强。Northwestern University 复杂系统物理学家 Luís Nunes Amaral 指出,科研界过度关注论文数量,忽略了研究内容及其对理解现实、健康和自然世界的贡献。材料同时提到,自动化工具降低了批量生产稿件和会议投稿的门槛,期刊编辑与会议组织者已经看到低质量及欺诈性论文或报告增加。AI 擅长利用充足数据优化蛋白质结构预测、图像分类和大规模数据模式提取等定义明确的问题;Evans 认为,如果缺少有意的设计和激励,相关系统及其使用者不太会进入数据稀少、问题更混乱的研究区域。
过去几年,公众对人工智能的集中认识主要来自大语言模型,但 AI 的研究与产品开发已不再只围绕语言展开。另一类被称为“世界模型”的系统正在获得更高预期、更多融资,以及研究和产品团队的持续投入;过去一年间,这一类别已经出现大量新公告。
世界模型与大语言模型的目标并不相同。它们不是只处理语言,而是以模拟物理世界为目标,或者至少生成一种足以服务具体任务的近似世界。语言能力可以被替代,也可以与这种模拟能力结合;核心方向是为能够表示和推演物理环境的 AI 系统打下基础。
现有讨论同时把世界模型的能力边界列为尚未解决的问题。相关系统所构建的是物理世界的模拟或实用近似,并不等同于完整复现现实;其工作方式、能够承担的任务以及仍未确定的限制,构成了这一技术类别当前研究和产品开发的主要议题。
Google DeepMind与印度国家转型委员会旗下Atal Innovation Mission推出ATL Saathi实时试点。这款由Gemini驱动的网页应用面向Atal Tinkering Labs教育者,提供全天候备课与培训辅助。该项目覆盖印度逾1100万名学生,涉及3D打印、物联网和机器人等技术教育。
ATL Saathi通过NotebookLM整理培训模块和课程材料,为12个核心模块生成摘要、信息图、视频概览及互动测验;另为10个模块提供分年级项目建议,以及组装步骤、接线图和安全措施。系统首批支持8种语言,并将在印度100所学校部署,底层模型为Gemini 3.5 Flash。
看英文原文 →一名Hacker News用户提议增加AI生成文章标记,让不愿阅读此类文本的用户可以直接跳过。该标记不必沿用普通举报机制,也不需要降低文章排序,只作为内容属性提示。相关讨论获得1093分和458条评论。
发帖者同时提出两个待讨论问题:现有投票系统是否已经足以筛选内容,以及Hacker News是否应为生成式AI时代调整产品机制。帖子也指出,该社区长期保持基本规则不变并取得成效,因此新增标记是否必要成为讨论重点。
看英文原文 →一项对比测试将Claude Code 2.1.207与OpenCode 1.17.18置于同一机器、模型和任务下,并通过模型端点前的日志代理记录请求载荷与API用量。执行仅回复“OK”的任务时,Claude Code在用户提示到达前发送约3.3万Token的系统提示、工具定义及脚手架,OpenCode约为7000。
测试称,72KB的AGENTS.md或CLAUDE.md平均会给每次请求增加约2万Token,5个MCP服务器再增加5000至7000。一个直接执行消耗12.1万Token的小任务,交给两个子代理后增至51.3万;Claude Code单次缓存写入最高为OpenCode的54倍。不过在一项多步骤任务中,Claude Code因批量调用工具一度总消耗更低,换用较新模型复测后则约为29.8万Token,OpenCode为13.3万。
看英文原文 →Rae McKelvey介绍的Mesh LLM可汇集多台机器已有的GPU与内存,并统一提供兼容OpenAI的API。请求可在本机GPU执行、路由至已加载模型的节点,或将单机无法容纳的模型按层拆分到多台设备,以流水线方式传递激活数据;客户端仍连接localhost:9337/v1。
各节点通过iroh端点建立以公钥认证的QUIC连接,由iroh处理打洞、NAT穿透和中继回退,系统另在不同地区运行两个中继。插件架构可通过MCP、HTTP、推理和网格事件提供能力,模型目录包含40多款模型,参数规模从5亿到2350亿。软件约18MB,可加入公共网格或配置私有部署;团队还计划基于iroh的Swift SDK开发移动应用,并支持ACP。
看英文原文 →Juggler 是一款开源图形化编程代理,面向希望直接检查和控制模型操作代码库的用户。它把会话组织成可编辑的树形 Yjs 文档,以类似 Finder 的 Miller 分栏展示工具调用、审批、上下文属性和嵌套子线程,支持分支、回退与比较,而非只提供线性聊天记录。
Juggler 由原生桌面应用和无界面命令行服务器组成,同一会话可由桌面端及多个浏览器客户端同步查看。它支持 macOS、Windows 和 Linux,可连接 Claude Code、OpenAI、Gemini、Ollama、OpenRouter、Z.AI、Deepseek 等;上下文项、命令、模型循环策略及界面均可通过 JavaScript 扩展。服务器默认仅限本机访问,开启局域网访问后不设密码。
看英文原文 →Ploy 已将所有工作区的网站构建代理默认模型由 Claude Opus 4.8 换成 GPT-5.6 Sol。该代理会规划页面、读取代码库、编写组件、生成图像并截图检查结果。Ploy 修正评测工具后发现,GPT-5.6 完成页面的速度为原来的 2.2 倍,成本低 27%,输出 token 约减半,评分达到或超过原模型。
首次跨模型评测中,约三分之一的原始失败来自评测框架假设,而非模型表现。GPT-5.6 会为工具的 25 个顶层参数全部填值,导致 52%至64%的文件读取返回空内容。Ploy 将可选字段改为必填但允许 null,并在调用前移除 null,空读取比例降至0%,完成相同任务所需的工具调用也减少约30%。
看英文原文 →Jacquard 是 FriendMachine 面向“模型编写、人工审查”代码开展的研究项目。每个函数签名都会列出可能产生的网络、文件、时钟和随机性等外部效果;检查器保证声明完整,运行时则拒绝执行命令行未明确授权的效果,包括动态加载代码产生的操作,使审查者可从签名判断改动能够接触哪些资源。
项目包含 OCaml 编写的检查器与解释器、可通过生成 C 编译独立原生程序的编译器、jac 命令行工具、标准库及 Warp 测试框架。0.1 版已能端到端运行,但定位仍是研究原型;官方提供 Linux x86-64、macOS Intel 和 Apple Silicon 二进制。它还支持替换外部世界处理器、枚举有限离散模型的精确概率,以及按解析后的规范结构生成程序身份。
看英文原文 →文章提出两种 AI 发展路径:一是少数构建前沿系统、掌握优先访问权并决定能力开放范围的人居于中心,其他人主要接受其产品与决策;二是让更多人学习指挥各自的 AI 代理,以人为中心放大个人能力。作者将前一种结构称为正在形成的“技术神职阶层”,并把就业替代与能力分配并列讨论。
文章援引 Dario Amodei、Sam Altman、Mustafa Suleyman 和 Elon Musk 对岗位自动化及收入分配的公开判断,同时列举生物安全、网络安全和虚假信息等限制能力开放的理由。作者认为,部分合作伙伴、研究人员和机构可获得更强能力,而普通用户使用受限版本,可能形成分层访问;软件开发者较早获得代理工具,则被用作个人自主驾驭代理的案例。
看英文原文 →从 26 条资讯中筛选
今日全部信源这一期是从下面这些一手英文信源里,筛掉噪音后留下的。