Meta CEO Mark Zuckerberg 在本周一次内部全员会上谈到 AI 智能体进展时,承认开发速度没有达到高层此前的预期。材料把这件事放在 Meta 今年组织调整之后来看:公司一边把更多资源押向 AI,一边试图让内部结构围绕 AI 重组;但 Zuckerberg 对员工说,智能体开发节奏并没有按管理层原先设想的方式加快。
据 Reuters 报道,Zuckerberg 在会上说,AI 智能体开发节奏没有以高管此前预期的方式“accelerated in the way”。据 Bloomberg 此前报道,Meta 今年早些时候裁掉约 8,000 名员工,约占公司企业员工的 10%,并把另外 7,000 人重新分配到多个 AI 小组,其中包括 Agent Transformation。Zuckerberg 还谈到这轮裁员,称处理得不如应有的那样“干净”;他补充说,裁员原因是公司高层担心 Meta 无法足够快地适应科技行业变化。
他还表示,新的 AI 导向组织结构被认为会带来的收益尚未兑现,但他相信未来 3 至 6 个月会开始看到 AI 投资带来的改善。材料还提到,Meta 数月前成立的 AI 单元曾被其他调查报道描绘为令部分工程师高度压抑的工作环境。Meta 在 AI 上投入很重;据 Reuters 报道,公司今年 AI 基础设施开支预计最高可达 1450亿美元。TechCrunch 已向 Meta 请求置评。
Meta 已低调推出名为 Pocket 的实验性 AI 应用,用户可以用文字提示生成小型互动应用和小游戏,并在应用内浏览、试玩他人制作的内容。材料称,Pocket 来自 Meta 今年早些时候收购 vibe-coded 游戏平台 Gizmo 团队后的成果;应用自称是一个用于制作和分享“gizmos”的创作平台,gizmos 是其对互动体验的称呼。
根据 Google Play 截图,Pocket 与 Gizmo 原应用有多处相似:两者都支持用书面 AI 提示生成小型互动体验,也都有发现信息流。逆向工程师 Alessandro Paluzzi 今早首先注意到该应用上线,并在 X 发布了 Play Store 截图;据应用情报服务 Appfigures 的数据,Pocket 实际上已于 2026 年 6 月 29 日在 App Store 和 Google Play 上线。由于应用刚上线,Appfigures 还无法判断它是否已经产生下载量。
Business Insider 和 Investing.com 也报道了 Paluzzi 的发现。Meta 尚未正式宣布 Pocket 上线,材料也写到 Meta 没有回应置评请求。Pocket 延续了 Meta 把 AI 创作工具推向普通用户的做法:此前 Meta AI 应用可生成 AI 图片,Vibes 应用可生成 AI 视频,公司还把 AI 功能加入多个社交平台和创作者视频剪辑应用 Edits。与 Pocket 对应的 Gizmo 已在 iOS 和 Google Play 累计获得 63.5 万次安装;据 Appfigures 统计,它的正面情绪比例为 98%。
一篇在 Hacker News 被讨论的研究解读把 AI 提效问题从演示和实验室拉回真实工资记录。文章承认 AI 在合适任务上确实能加快写作、客服和结构化初稿;但在实际岗位中,收益缩小到约 2.8% 的总工时,放错任务还会倒扣成本,而且很少进入工资或公司损益表。其问题不是 AI 能否让知识工作更快,而是节省时间是否被转成钱。
文中引用经济学家 Anders Humlum 和 Emilie Vestergaard 的研究:他们把约 25,000 名员工、7,000 个丹麦工作场所的 AI 采用调查,与真实薪资记录相连。结果显示,聊天机器人节省约 2.8% 工时,约等于每周 1 小时;但对各职业收入或记录工时没有显著影响,只有 3% 至 7% 的生产率收益传到薪酬。文章对照了任务实验:453 名专业人士用 ChatGPT 写新闻稿、短报告和敏感邮件时,用时少 40%,质量评分高 18%;5,179 名客服接入 AI 助手后,平均每小时解决量提高 14%,新手提升约 34%。
材料还列出能力边界的反向结果:Harvard 和 BCG 对 758 名顾问的现场实验中,GPT-4 在能力范围内让使用者完成任务数增加 12.2%、速度提高 25.1%、质量评分高出 40% 以上;但任务被放在 AI 能力范围外时,使用 AI 的顾问比不用 AI 的顾问答对概率低 19 个百分点。企业层面,MIT Project NANDA 2025 年报告称,300 亿至 400 亿美元企业投入后,95% 的组织获得零回报,多数试点没有可衡量的损益影响,只有 5% 提取到真实价值。MIT 经济学家 Daron Acemoglu 估算,AI 十年内对全要素生产率的提升不超过约 0.66%,且很可能低于 0.53%。
印度连续创业者 Bhavin Turakhia 正用个人资金押注企业 AI 办公。据 TechCrunch,他将向新公司 Neo 投入 3000 万美元,认为生成式 AI 的技术变化足以让办公软件从头重做,而不是在旧产品上加聊天机器人。Neo 今年 4 月先在内部上线,整合项目管理、文档、文件存储和 AI。
Turakhia 曾共同创办 Directi、Radix、Titan 和银行软件公司 Zeta。Neo 目前在他的公司内部使用,包括 Zeta,计划未来几个月面向中型企业推出,先覆盖技术、咨询和专业服务公司的知识工作者。公司位于 Bengaluru,现有约 45 人,其中 18 名工程师;年底前预计增至约 100 人,多数新岗位集中在 AI 和软件工程。
看英文原文 →Midjourney 公开了更多医疗扫描仪幕后画面。这个以图像生成为人熟知的 AI 初创公司发布近 20 分钟视频,展示一种浸入式超声扫描装置,计划部署在 spa,并希望用于便宜、细致、无辐射的成像;材料同时称,视频仍未展示太多证明其有效性的证据。
视频来自 tech YouTuber Marcin Plaza,他同时是 Midjourney 工程师。Plaza 介绍,这套装置由数十个被拆改的超声探头组成,安装在类似带升降结构的浴缸设备上,并连接现成电脑和 Raspberry Pi。材料还展示了 imaging phantom 扫描图,用于在受控条件下验证结构分割是否清晰。
看英文原文 →Google DeepMind 和 A24 宣布建立一项以研究为中心的合作,称其为 first-of-its-kind partnership。合作把研究实验室与电影工作室的创作流程连接起来,目标是让艺术家参与未来工具的工作流和技术开发,使相关工具由实际使用它们的创作者共同塑形。
这项合作将覆盖多个项目,并以长期研发形式展开。A24 及其 filmmakers 将在创作过程中试用 Google DeepMind 的技术,反馈新技术是否服务于他们的表达和叙事;Google 也已投资 A24。材料称,初期重点是连接前沿技术与下一代娱乐,具体目标、技术产出和创意里程碑会随合作推进而演变。
看英文原文 →arXiv:2607.01510v1 摘要介绍了 Janus,一个用于实现和评估用户参与式 agentic permission management 设计的 playground 系统。论文背景是,AI agents 能代表用户自主执行 tool calls,因而带来权限管理问题:用户可以、也应该在其中扮演什么角色,现有研究仍不足。
Janus 包含 Janus-Core 和 Janus-Harness:前者支持多种权限管理设计,后者用于自动评估。研究实现 6 个 permission assistants,并在 3 个场景和 3 个 synthetic responders 上评估。结果显示,用户输入能加强隐私和安全,AI 辅助可降低认知负担,权限疲劳等真实行为需纳入设计;没有单一设计在所有情境下最优。Janus 已公开可用,用于后续研究。
看英文原文 →arXiv:2607.01567v1 摘要介绍了一项针对偏好学习监督的研究。研究把 Scalable Oversight via Lie Detectors(SOLiD)扩展到更大的模型,并放到更多样、更接近现实的偏好学习设置中评估;SOLiD 的做法是用测谎器筛出需要高成本标注者复核的回答。
结果显示,在检测器真阳性率为 99% 时,未被发现的欺骗从 1B 参数模型的 34% 降到 405B 参数模型的 14%。研究还称,昂贵的人类标注者可从微调阶段完全移除,且欺骗没有统计显著增加;但 SOLiD 对检测器训练数据与偏好训练数据之间的分布偏移敏感,可能把误报率推高到难以实际使用的水平。
看英文原文 →一份名为 Jamesob's guide to running SOTA LLMs locally 的 README 在 Hacker News 获得 239 分、114 条评论。作者说明该 repo 包含自己本地运行前沿模型的硬件、购买理由、配置经验、本地 speech-to-text 设置,以及用 Docker 容器运行模型的现成配置。
材料中给出两个档位:约 $2k 可用 2x RTX 3090 获得 48GB VRAM,运行 Qwen3.6-27B 和 whisper-large-v3;更高档位提到 4x RTX 6000 Pros、合计 384GB VRAM。作者称自己使用上代 DDR4 EPYC 系统、eBay 零件、c-payne.com 的 PCIe4 switches、两块 8TB 硬盘上的 ZFS,并把模型权重缓存在 ~/storage 后由各目录的 docker-compose.yml 启动。
看英文原文 →pxpipe 是一个本地代理,目标是把 Claude Code 请求中体积较大的系统提示、工具文档和旧历史内容渲染成 PNG,再发送给模型读取,从而减少输入 token。材料称,图片 token 成本由像素尺寸决定,而不是由图片内文字多少决定;代理只压缩请求,不压缩模型输出,近期回合仍保留为文本。
材料给出的测量结果包括:在当前 Fable 标价下,端到端账单下降约 59–70%;13,709 个请求快照从 $100 降到约 $41,另一个 8,904 个压缩请求轨迹约降 70%。它也列出限制:密集图片中的精确 12 位十六进制字符串,Fable 5 为 13/15,Opus 为 0/15,且错误可能是静默编造;SWE-bench Lite 试点两组均为 10/10,SWE-bench Pro 为开启 14/19、关闭 15/19,请求大小约降 60%。
看英文原文 →git-annex 维护者称,过去一个月花了约 100 小时,确认 git-annex 至少目前能在不依赖包含 LLM 生成代码的依赖项的情况下构建。他把这件事描述为需要持续审查整个依赖树,并表示获得的依赖质量信息会影响未来决策。
材料列出他在审查中发现的情况:大量 LLM 生成改动在下一版被撤回且没有解释;一个 26,000 行代码库中出现 10,000 行改动和 1,489 行语无伦次的提交信息;还有一个 LLM prompt 要求从另一个项目复制代码,似乎只是因为运气才避免构成版权侵权。他还提到 Software Freedom Conservancy 和 FSF,并表示自己仍继续工作和支持用户。
看英文原文 →据 LeadDev’s Engineering Leadership Report 2026,45%的受访工程师称每周工时比去年同期更长,高于2025年的38%;staff、principal、distinguished 等高级工程师增幅最大,2026年为53%,2025年为28%。材料称,这与AI会释放工程师时间的叙事相反。
开发者 Steve Yegge 在2026年2月写到,AI-powered coding 具有成瘾性,长期 vibe coding 后会突然疲惫入睡。报告还称,49%的软件工程师每周至少一次感到工作中情绪耗竭,高于2025年的39%;CTO为54%,2025年为24%。Rebecca Koniahgari 对 LeadDev 表示,AI移除了传统编码中的停顿点,使会话更难主动结束。
看英文原文 →从 59 条资讯中筛选
今日全部信源这一期是从下面这些一手英文信源里,筛掉噪音后留下的。