NOW ROOM / 当下观察簿
能力,只是变化的一部分。
五份一手记录展示同一时刻的变化:AI 系统处理更长任务、进入有边界的实验流程、连接设备、接受更严格的评测,并开始携带来源信号。
READING KEY / 3 LAYERS
先辨认主张,再阅读标题。
每份记录把发布方自述、日期页面能够证明的事实与博物馆解读分开。“当前”只表示在所示日期完成核对,不代表永久有效。
- 01发布方怎么说
只概括对应机构自己的公告,并明确归属。
- 02记录能证明什么
只写这份带日期的一手页面本身可以核对的事实。
- 03博物馆怎么看
解释为什么值得收藏,同时把边界留在原处。
- 01案例研究
OpenAI
AI 智能体进入量子比特校准回路
合作方案例研究已核对;它记录有边界的常规流程,不是独立复现,也不代表普遍的实验室自主能力。
观察中01 发布方自述
OpenAI 表示,MIT EQuS 的研究者通过 Codex 把 GPT‑5.6 Sol 接入实验室软件,使智能体可以运行、分析并调整常规的超导量子比特测量。
02 记录核对
带日期的页面链接到一份由 MIT 与 OpenAI 作者署名的案例研究,其中记录了此前未校准的六量子比特芯片、软件访问安排、测量步骤、示例结果,以及仍需人工指导的情况。
03 博物馆解读
值得收藏的变化不是“AI 发现了新物理”,而是模型开始通过软件接触真实仪器。这仍是合作方发布的案例研究,不是独立复现;信号含糊时,实验专家的判断依然关键。
- 02发布记录
OpenAI Developers
GPT-6 Astra 进入 API 更新记录
已进入 API 更新记录;接口信息核对于 2026-09-11。
当前01 发布方自述
OpenAI 将它描述为面向推理、编程、计算机操作、研究、文档生成与长任务工具协作的模型。
02 记录核对
9 月 3 日的更新记录列出 `gpt-6-astra`、Responses 与 Chat Completions;工具调用要求使用 Responses,并新增异步工具调用、工作中途转向和会话内调整推理强度。
03 博物馆解读
可长期保存的事实是模型标识和接口变化。性能排名与“最强能力”等措辞仍属于 OpenAI 自述,本站不把它们改写成独立比较结论。
- 03研究预览
Anthropic
智能体与仪器之间的一种预览接口
研究预览;本站不把它视为已采纳标准。
观察中01 发布方自述
Anthropic 把 Model Hardware Standard 描述为一套共享、模型中立的规范,让智能体操作可编程的实验室与制造设备。
02 记录核对
公告向首批合作方开放早期研究预览,并写明一种带 read/write 原语、设备描述和安全边界的驱动,可通过 MCP、命令行或代码访问。
03 博物馆解读
这能证明一套接口提案和合作方预览已经出现,不能证明 MHS 已成为行业标准,也不能证明公告中的集成效率会普遍复现。
- 04评测试点
Google DeepMind
一次模型评测的双盲试点
试点已公布;方法与后续结果仍在观察。
观察中01 发布方自述
Google DeepMind 表示,加密环境可以让模型提供方看不到保密测试题,同时让评测方看不到专有模型权重。
02 记录核对
8 月 27 日的记录列出合作机构、受测的 Gemini Flash Lite、机密计算环境,以及一份说明试点方法的技术报告。
03 博物馆解读
这项试点处理的是评测完整性与题目污染问题。它本身不能证明模型能力,也不意味着所有基准已经独立或这种方法已被普遍采用。
- 05发布记录
Meta AI
Muse Image 发布时带上来源信号
可用范围不一;这份记录中的视频与检测能力尚未全部发布。
观察中01 发布方自述
Meta 发布 Muse Image、预览 Muse Video,并把 Content Seal 描述为随部分 Meta 界面生成图片附带的不可见来源信号。
02 记录核对
7 月 7 日的发布记录区分了已提供与尚未提供的部分:Muse Image 只在列出的产品和地区上线,Muse Video 随后推出,Content Seal 检测工具仍是预览。
03 博物馆解读
来源信号可以辅助检查,但不能证明作者身份、内容真实性或未经编辑的完整流转链。可用范围和抗变换能力仍需后续复核。