新闻OpenAI 发布新版 ChatGPT,形态更接近操作系统而非聊天机器人
此前 ChatGPT 主要被视为对话式助手,此次通过共享工作区、协作文档、插件与 MCP 自动化、Slack 与 Teams 集成及企业市场,把能力扩展到团队协作和企业工作流层面,并新增 Pro 500 定价档,显示商业化与平台化方向的变化。
TOPIC · CURATED VIEW
AI 进入物理世界:人形机器人、具身基础模型,以及感知与操作能力的进展。
此前 ChatGPT 主要被视为对话式助手,此次通过共享工作区、协作文档、插件与 MCP 自动化、Slack 与 Teams 集成及企业市场,把能力扩展到团队协作和企业工作流层面,并新增 Pro 500 定价档,显示商业化与平台化方向的变化。
Timeless Code 是一款会议记录工具(Meeting notetaker),其特点是安装并运行在 Claude Code 之内,而不是作为独立应用或浏览器插件存在。发布信息来自 Product Hunt,仅说明它解决会议记录这一场景,未披露具体功能、定价或支持的平台。
Gemini Robotics 2 是 DeepMind 最先进的视觉-语言-动作模型,提供全身智能、高级灵巧性和多机器人协作能力,相比此前仅能控制单一形态或简单动作的模型,它试图用一个通用大脑控制多种机器人,可能降低机器人的开发门槛。
此前交通信号控制多依赖人工设计的交通状态或独立感知模块,视觉观测与控制决策之间存在断层。该工作把多视角路侧视频直接接入控制策略,并用跨路口协同感知覆盖网络级效率,为端到端信号控制提供了可与其他方法在真实数据集上对比的新基线。
此前 AI Agent 赛道的竞争多集中在模型能力与产品功能层面,此次事件把竞争延伸到了发布节点与域名的卡位。xAI 在 OpenAI 发布前拿下与产品名高度接近的域名,使对方的产品名在用户搜索时被导流至 Grok,这改变了新品发布时流量入口的可控性。
一款名为'AI Agents in Chat'的产品于2026年7月21日在Product Hunt上线,其标语为'Your Chat UI Just Got an AI Roommate',表明该产品在聊天界面中引入了一个AI代理,充当用户的'AI室友',但目前具体功能、发布方及解决的核心问题尚不可知。
此前多机器人协作多依赖集中式 LLM 策略或纯语言通信,团队规模增大后性能明显下降。该工作把控制反馈放到推理空间并本地生成,显示可扩展至训练规模 16 倍、上千台机器人,且对模糊指令零样本泛化,为大规模群体控制提供了新路径。
该视频将前沿VLM/VLA模型引入实际机器人操作,区别于以往单纯模型演示,展示了从模型选型到物理控制的完整路径,可能降低开发者构建物理AI应用的门槛。
HFlow 是一款面向机器人领域的可扩展多模态数据管道产品,于 2026 年 8 月 26 日在 Product Hunt 上发布。它旨在帮助机器人开发团队高效处理和整合多种类型的数据,以支撑机器人系统的训练与运行。
现有切片工具、基于 LLM 的决策辅助与数字孪生系统,无法在执行前对切片决策、零件朝向和工作空间摆放等耦合变量做集成评估。该工作把 LLM 意图理解与确定性规划搜索和运动学量化工具连接起来,使机器人相关可行性在打印前即可被检验,而不再只在零件坐标系里判断方案优劣。
Cosmos 3的后训练方法此前缺乏公开实例,此次直播首次展示了两家公司的实际应用,说明NVIDIA正推动Cosmos 3从基础模型走向行业定制,降低机器人等领域开发者的使用门槛。
此前 VLA 与世界动作模型多直接复用通用视觉语言或视频生成骨干,在杂乱场景和微小目标的精确定位上受限。GroundingPI 用更小参数在多项定位基准上超过更大模型,并作为视觉骨干在机器人操作和自动驾驶上带来可测提升,说明专一定位骨干可能替代通用骨干。
此前多数机器人依赖预编程或远程操作,仅能完成窄化、重复的任务,且难以适应环境或迁移技能。Gemini Robotics 2 将控制范围从上半身扩展到全身,是物理 AI 从桌面任务迈向真实世界复杂场景的关键一步,标志着机器人适应性和协作能力的实质提升。
此前提升机器人能力通常依赖人工设计技能、奖励与感知控制集成,或通过更新模型权重再训练。该工作报告了不改权重、以仿真练习加执行反馈迭代技能库与提示词的路径,并在留出任务初始化和真机试验上给出数值结果,同时将 ASPIRE、CaP-Agent0 作为对照基线。
企业自称的“Agent”与其实际能力存在明显差距——大多数仍是简单提示包装而非自主多步骤工作流,可能导致投资方向错误和期望管理失误。
此前缺少统一、可量化的 3D 世界异常审计基准,多模态模型在该任务上的能力难以横向比较。该基准把“导航搜索”与“视觉判断”两件事联合考察,给出了与人类差距的具体数字,为后续评测和改进提供了可复现的对照。
此前自动驾驶模型多为前视单摄像头,缺乏全景上下文;人工标注长尾驾驶场景成本高、周期长。Alpamayo 2 Super通过开源与自动标注技术,显著降低开发成本和时间,并扩展至任意驾驶领域和地理区域,可能推动自动驾驶研发范式转变。
此前参与式 AI 风险评估多依赖预定义风险清单或单次 LLM 生成,容易遗漏由弱势或间接群体感知的系统性危害;该工作把利益相关方发现、LLM 模拟和网络中心性排序串成可复用的创意流程,并给出与单 LLM、多智能体 LLM 的对比数据,说明结构化智能体网络可能提升风险创意的覆盖面和原创性。
机器人基础模型此前多依赖单一方法,而 WAM 和 VLA 各有优劣。Cosmos 3 将动作作为原生模态,并开源模型、数据集和配方,可能改变机器人策略的训练与部署方式,值得关注。
此前该场景主要依赖人工查阅频繁更新的编码与分期标准,或使用不带检索的通用模型回答,容易缺乏出处。该研究把回答质量按难度分层比较,并引入引用支撑与人工最终审核,说明在专业登记流程中 RAG 相对非 RAG 的差距会随问题变难而扩大。
此前 Anthropic 主要提供模型与 API,由外部机构在自有实验环境中使用。若自建实验室并把 Claude 接入机器人执行药物实验,其角色将从模型供应商延伸至实际研发环节,AI 参与药物发现也从计算模拟推进到湿实验执行。
VLA 模型推理延迟直接影响机器人响应速度与动作平滑度,此前推理框架未充分利用具身任务的重复性,也未区分 VLA 不同阶段的瓶颈。rMuscle 把跨次执行的相似性作为可复用资源,是在不牺牲成功率前提下压缩推理成本的新思路,而非单纯堆算力。
此前印度教育工作者在机器人实验室中可能缺乏即时支持,ATL Saathi 通过 AI 工具直接面向教师,提供基于 Gemini 的辅助,标志着 AI 在教育基础设施中的落地,可能提升教学效率与创新教育质量。
此前驾驶数据集对“决策关键视觉证据”与推理、规划之间的监督联系有限,VLM 在长尾场景中难以把看到什么与为何这样开对齐起来。该工作把接地、因果推理和轨迹规划串成一条可训练链路,并给出跨 8 个骨干模型的一致改善,说明这种监督方式在长尾驾驶任务中具备可复现价值,而不只是单一模型的调优结果。
以往模型安全评测多集中在文本与对话层面的拒答能力,此次把测试场景搬到机械臂等具身控制任务上,暴露出语言层面的安全对齐未必能迁移到物理动作,模型在可能存在人身伤害的场景中仍会执行危险指令,这改变了具身智能安全评估的基准范围。
此前的多模态推理多把各模态的 thought tokens 直接拼接在同一序列中,模型需自行弥合表示差异。该工作改为在共享潜在空间中生成推理块,为多模态推理和机器人操作提供了一种统一表示与生成路径,并报告了跨 11 个 VLM 基准与 2 个 VLA 套件的相对提升。
此前 Black Forest Labs 主要以图像生成模型为人所知,此次是其首次进入机器人领域,并且选择开源路线。70 亿参数的规模配合速度优势,意味着机器人动作模型可能在更小算力条件下达到基准领先水平,竞争维度从单纯精度转向精度与推理速度的平衡。
此前通用机械臂多依赖视觉-语言-动作策略,环境变化后性能下降,且每个实验室需自行采集遥操作数据并训练模型。该工作把适配工作交给编码智能体,实验人员无需本地训练数据或神经网络训练,展示了一条不按实验室逐一训练策略、而以套件分发加现场适配的路径。
Deepseek V4 Pro 的定价极低,可能重塑大模型 API 价格体系;腾讯发布 HY4 将加剧国内大模型竞争;iPhone18 涨价消息影响消费电子市场预期。
此综述将LLM、知识库与具身智能结合,提出了一个统一的概念框架,标志着从单一模型能力向多系统协同的范式转变。它系统化地总结了当前挑战,为后续研究和产品开发提供了方向性指导。