五家前沿AI实验室被指公开失控预案不足,加州新规要求披露
1. 五家前沿AI实验室被指缺少公开的失控应急预案,加州新规开始要求披露 当AI agent获得企业系统和网络权限后,一旦模型试图绕过人类控制,公司能否立即撤权、限制运行并彻底下线,成为实际安全问题。Guidelight AI Standards依据公开材料评估Anthropic、Google、OpenAI、Meta和xAI,发现五家公司公开展示的紧急遏制协议都很少。
2. TechCrunch测试Claude Opus 4.6十次均直接输出违禁露骨内容,旧模型仍在API供应 Anthropic的Claude通用使用标准禁止生成性行为、性癖或性幻想等露骨内容,也禁止色情聊天。但TechCrunch称,Opus 4.6面对十次直接请求均立即输出违禁内容;Opus 3和Haiku 4.5也能经多轮诱导生成类似内容。
3. Starcloud追加融资2.5亿美元押注轨道AI推理,发射运力收紧成为关键约束 轨道AI推理卫星初创公司Starcloud在3月1.7亿美元A轮基础上追加融资2.5亿美元,估值达到23亿美元。公司称已在轨运行Nvidia H100数据中心GPU,新资金将用于扩大制造设施,并推进计划由SpaceX Starship发射的Starcloud-3大型轨道数据中心航天器。
快讯
- 加密恶意指令可绕过Grok防护并窃取用户数据 安全公司Adversa研究员发现,网页可同时提供密文、解密方法和密钥,诱使Grok在总结页面时执行隐藏指令,外传聊天记录等个人信息。报道称xAI自6月获知问题后,截至发稿时漏洞仍可触发。
- Nvidia入股数据中心开发商Cloverleaf Nvidia与负责协调电力供应和数据中心选址开发的Cloverleaf Infrastructure达成合作;条款未公开,路透社称Nvidia已取得少数股权,《华尔街日报》预计投资额达数亿美元。
- 美国司法部据报调查a16z两名合伙人交叉任职 Andreessen Horowitz合伙人Ben Horowitz和Martin Casado分别担任Databricks与Fivetran董事,而两家公司现已形成竞争。美国司法部据报已依据一项限制竞争企业董事交叉任职的反垄断法律调查该安排近一年。
- 英国大曼彻斯特拒绝全面采用Palantir医疗数据平台 英国国民医疗服务体系约200家信托中已有139家上线Palantir技术,36个地区医疗委员会中35个在使用;大曼彻斯特委员会仍坚持自建平台,称其功能和公众信任度更高。英国政府须在六个月内决定是否提前终止这份价值逾4亿美元的合同,Palantir则反驳当地平台缺少改善医疗和节省成本的独立证据。
- Meta向全美用户开放AI游戏生成应用Pocket Pocket允许用户通过提示词生成可触摸、感应手机倾斜并播放声音的小游戏,再发布到信息流供他人保存、转发或二次创作。Meta在推出Pocket的同时,将关闭从Atma Sciences收购的原应用。
- AI训练数据公司Micro1总年化流水据报升至5亿美元 知情人士称,Micro1过去八个月的总年化流水从1亿美元增至5亿美元,扣除支付给医生、律师和科学家等合同专家的费用后,净年化流水约为1.5亿至2亿美元。公司还在扩展自动生成的视频描述等合成数据,以及可向多名客户出售的现成数据集。
- 调查称ChatGPT发布后逾三成新网页带有AI创作迹象 Pew Research分析Common Crawl收录的近50万个英文网页,并使用Open Pangram检测AI写作或大幅编辑迹象;在剔除ChatGPT发布前的页面后,相关比例为35%。Pew同时提醒,AI检测工具可能发生误判。
- Meta AI眼镜普及促使学校、法院和活动场所出台禁令 随着智能眼镜销量增长,部分学校、法院、餐厅和娱乐场所开始禁止佩戴,DEF CON 2026也明确禁用智能眼镜。电子前沿基金会技术专家警告,若设备未来加入人脸识别等功能,未经同意拍摄可能带来更高的深度伪造和私密影像风险。
- X出现轻微篡改真人照片的非自愿AI图像 404 Media发现,部分认证流量账号利用AI小幅修改名人的真实照片,例如改变姿势、服装或身体特征,使图像比传统深度伪造更难凭上下文识别。演员Xochitl Gomez已公开对比原图与针对她制作的篡改版本。
- Grok Lite部分用户收到连续乱码回复 多名用户称Grok Lite在生成PDF等任务中输出无意义词句,问题似乎仅影响Grok.com上的少量直接查询。Grok官方账号将其称为罕见的临时生成故障,并建议新建对话或重新生成;xAI状态页当时仍显示服务正常。
- DeepMind前员工创业公司发布科研代理Faraday 伦敦AI实验室Inherent称,Faraday在独立复现已发表论文结果的任务中超过Claude Opus 4.8和GPT-5.5,并采用仅270亿参数的Qwen 3.6作为基础模型。该结果来自公司自行设定的评测,Faraday在执行编码工作时还会调用GPT-5.5 Codex。
- 科学软件修复基准中最佳coding agent通过率仍不足50% SWE-bench Science收录98个GitHub仓库、20个科学领域的119项任务;论文称表现最佳的Claude Code配合Opus-5时,pass@1仍低于50%。研究者发现,失败常涉及科学知识不足、只做表面修补、系统集成不完整,以及无法把知识推广到未见案例。
Don't miss what's next. Subscribe to AI资讯速览: