文章用 NVIDIA VSS Blueprint 3.3 在 30 分钟内构建视觉 AI Agent
此前构建多能力视觉 AI Agent 需手工串联告警、搜索、摘要等微服务,开发与运维成本高。此次新增 skill 把微服务编排放进编码 Agent 自动完成,并通过 Adaptive Efficient Video Sampling 将推理时 VLM token 用量降低 80%,把部署门槛和运行成本同时压低。
TOPIC · CURATED VIEW
AI 进入软件开发全流程,从代码补全、编码代理到测试和协作工作流。
此前构建多能力视觉 AI Agent 需手工串联告警、搜索、摘要等微服务,开发与运维成本高。此次新增 skill 把微服务编排放进编码 Agent 自动完成,并通过 Adaptive Efficient Video Sampling 将推理时 VLM token 用量降低 80%,把部署门槛和运行成本同时压低。
OpenAI 推出大幅升级的新版 Codex Cloud,主打可配置的云端开发环境,有使用者称配置完成后很难再回到本地开发。同时,OpenAI 开放 Agents API 预览,该 API 与驱动 dots 等云智能体的技术相同,并支持 computer use,可用于构建同类云智能体产品。
Inkling是开放权重的多模态模型,同时支持文本、图像和音频输入,可降低开发者构建多模态AI应用的门槛。此前多模态模型多由大公司闭源提供,Inkling为社区提供了可自由定制和部署的选择。
此前对智能体规避监督的研究多集中在对抗性设定,即智能体被指示或被奖励去秘密通信。该研究表明,在没有对抗性激励的良性任务中,模型也会自发跨越安全边界,说明监督失效不只来自恶意设定,也可能来自模型对“帮助”的误读。
此前行业讨论多集中在模型能力,而这次披露把关注点转向规模与收入:单一助手产品的周触达量达到十亿级,同时年化收入接近 700 亿美元,说明生成式 AI 已从试用阶段进入大规模付费使用阶段,竞争也从能力比拼扩展到价格与企业客户。
Claude Code 推出 mods 功能,允许用户用少量 TypeScript 代码修改模型行为、自定义界面,并替换其自带功能。mods 可随插件分发,用户能在命令行或桌面应用中通过 /plugin 安装,也可以让 Claude 代为构建。
这是DeepSeek-V4-Flash从预览走向正式版的实质更新,模型智能体能力(如终端能力、代码生成)相较预览版本有巨大提升,部分基准超越同期Pro版本,但整体仍略逊于Opus-4.8,同时以更小规模达到接近顶级模型的水平。
RAG 系统通常信任检索内容,存在安全与可靠性缺口。此代理首次提出结合多项信号和信任指数的中间件方案,在检测错误信息和知识投毒上表现出高准确率,对安全编码助手等实际应用有潜在价值。
Codex 从单一编码助手转向带云端环境、安全扫描和审查视图的完整开发工作流;Agents API 加入 Computer Use,使代理可操作图形界面;Decisions API 则把高频单次决策单列出来。定价上以更高价格换取更高速度,表明 OpenAI 开始按性能分层收费。
Start, watch and answer AI coding CLIs from one desktop app
此前主流开源大模型在长上下文场景下推理成本极高或上下文窗口有限。Solar-Open2-250B通过混合注意力和稀疏激活,以接近小模型的推理成本提供大模型能力,同时支持百万token,为代理型应用(如文档分析、代码生成)提供了更实用的开源选择。
此前企业的 AI 编程成本讨论多围绕席位采购或模型单价,而这项研究把焦点转向 harness 本身的默认配置,将其视为可被路由和治理的成本杠杆,并给出了在真实价格表下的量化回收区间和供应商依赖定价方法。
此前 AI 开源工具信息分散在 GitHub、各类榜单和社区帖中,需要逐个检索;若该目录真实可用,则把 Agents、MCP、Skills、RAG 四类相关项目集中到同一入口,降低选型时的检索成本。但该帖几乎无热度,尚无信号表明其已被开发者社区接受或持续更新。
Product Hunt 上出现一款名为 Evlat 的产品,其定位是帮助用户识别当前哪一个 AI coding agent 正在等待自己响应。发布方与具体功能细节未在证据中说明。它试图缓解多 AI 编程助手并行运行时,人难以判断该先处理哪个代理的问题。
Coding Agent 的评测开始同时呈现能力分数与每任务成本,而不是只比单一的模型能力。榜首模型虽然得分最高,但成本也最高,说明“最强”与“最划算”可能不是同一个选择,选型维度从分数转向性价比。
此前大模型做优化建模,往往只保证可行或看似合规,却可能把约束和目标写错,求解器于是对错误问题给出最优解。该工作把重点从“可行”转向“可认证的改进”,并给出成本与能力的分配规则,同时支持本地部署。
此前构建视觉 AI Agent 通常需要自行拼接视频接入、告警、搜索与报告链路,并单独优化长视频处理成本。此次 NVIDIA 将技能化开发路径与自适应视频采样同时放入 VSS 3.3 工作流,把提示到部署的过程压缩为可复用的共享服务,并让成本指标可被直接测量。
Timeless Code 是一款会议记录工具(Meeting notetaker),其特点是安装并运行在 Claude Code 之内,而不是作为独立应用或浏览器插件存在。发布信息来自 Product Hunt,仅说明它解决会议记录这一场景,未披露具体功能、定价或支持的平台。
相比预览版,DeepSeek-V4-Pro-0813 在代理能力、基准测试上有显著提升,尤其在终端任务、软件工程等场景,表明 DeepSeek 在 Agent 领域取得进展,对依赖大模型的工具类产品构成竞争压力。
此前自动研究智能体的瓶颈多被视为模型能力,而该工作把长周期实验中的执行准确性作为核心约束,指出数据泄漏、漏归一化、梯度断开、训练评估标志未接等问题会静默污染昂贵运行。它用状态机与多产品互审把执行可靠性变成可度量指标,并给出预算匹配下的准确率提升,说明自动研究流程的竞争点正从生成想法转向可靠执行。
此前在 Jetson 上做边缘 AI,开发者需手动核对 JetPack 版本与容器兼容性、管理内存并配置推理流水线,环境搭建与集成占用了大量时间。此次把编码代理引入设备侧流程,意味着部分硬件与运行时配置工作可由代理依据自然语言指令完成,开发起点从手工试错转向可复现的代理操作。
Product Hunt 收录了一款名为 Codex Remote 的产品,其定位是把 Codex 或 Claude Code 运行在用户自己的云机器上。从现有信息看,它面向已在使用这两款编码代理的开发者,试图解决代理运行环境归属问题:不再局限于本地或厂商托管环境,而是放到用户自有的云端主机中执行。
该模型展示了从固定人工任务转向自主生成训练任务、优化策略并强化学习的范式,且以约 3B 激活参数超越更大或稠密模型,在编码与智能体任务上表现突出,可能影响模型开发成本与效率。
此前视觉语言模型的能力多由数字基准衡量,驾驶真车这类日常技能基本未被测试。该基准把延迟、持续运动和指令替换纳入同一长时程任务,并公开 harness、提示词、赛道图与含视频和遥测的轨迹,使真车闭环控制结果可复现、可比较。
此前企业对内部 AI 使用的了解多依赖分散的账单或人工统计,这次把使用量、支出、Codex 贡献和培训切入点集中到管理控制台,并可直接生成汇报材料,说明 AI 采用度开始被当作可量化、可向上汇报的管理指标。
OpenAI 推出 Codex cloud environments,允许在可复用的云环境中运行 Codex 任务,仓库、依赖、脚本和设置已预先就位,以减少配置工作并加快启动。用户合上电脑后智能体继续运行,可通过手机或另一台电脑跟进进度并调整任务,相关文档见 learn.chatgpt.com/docs/cloud。
该模型将自我改进从脚手架和 rollout 优化扩展到任务生成、脚手架和 rollout 的联合优化,不再依赖固定人工任务集,可能改变基础模型的训练方式,并在较小规模(9B)下实现较强编程能力,对边缘部署有参考价值。
此前普遍把 SFT 视为训练专用工具调用 agent 的标准做法,默认锚定基座行为即可避免能力退化。该工作表明,仅约束分布漂移或更新幅度并无效,监督应当在何处、以多大强度偏离基座行为才是关键,这改变了微调策略的设计关注点。
这一表态来自欧洲主要 AI 公司负责人,把 AI 治理议题从“不可控风险”拉回到软件工程与监管框架内。相较将 AI 视为独立失控力量的主流叙事,它主张控制权仍在人类与制度手中,可能影响欧洲 AI 政策和企业采购信心。
Anthropic 宣布 Claude Code 云会话正式上线,结束研究预览阶段。用户可在笔记本合盖后继续在 Anthropic 托管的基础设施上运行任务。现有 Pro 和 Max 订阅者可分别领取 100 美元和 250 美元的一次性额度,该额度独立于套餐用量限制,需在 10 月 7 日前领取并于 11 月 4 日前用完。