16
模型DeepSeek V4闪存版官方发布,智能体能力大幅增强
筛选线索Agent 智能体AI 编码AI 公司模型家族1 个独立信源
这是DeepSeek-V4-Flash从预览走向正式版的实质更新,模型智能体能力(如终端能力、代码生成)相较预览版本有巨大提升,部分基准超越同期Pro版本,但整体仍略逊于Opus-4.8,同时以更小规模达到接近顶级模型的水平。
Hugging Face Model Radar/
6617
此前主流开源大模型在长上下文场景下推理成本极高或上下文窗口有限。Solar-Open2-250B通过混合注意力和稀疏激活,以接近小模型的推理成本提供大模型能力,同时支持百万token,为代理型应用(如文档分析、代码生成)提供了更实用的开源选择。
Hugging Face Model Radar/
6618
Coding Agent 的评测开始同时呈现能力分数与每任务成本,而不是只比单一的模型能力。榜首模型虽然得分最高,但成本也最高,说明“最强”与“最划算”可能不是同一个选择,选型维度从分数转向性价比。
AIHOT · X / 公众号精选/
6619
此前开源权重图像模型在两个 AA-Image 榜单上均未达到这一位置,Qwen-Image-2.1 同时超过 Ideogram 4.0(Quality)和 HunyuanImage 3.0 Instruct,说明开源权重方案在文生图与图像编辑两个维度上已进入可对比头部模型的行列,而不再只是低成本的替代选项。
AIHOT · X / 公众号精选/
6620
相比预览版,DeepSeek-V4-Pro-0813 在代理能力、基准测试上有显著提升,尤其在终端任务、软件工程等场景,表明 DeepSeek 在 Agent 领域取得进展,对依赖大模型的工具类产品构成竞争压力。
Hugging Face Model Radar/
6621
同一系列从上一代开源第13、净得分为负,变为新一代开源第5且净得分为正,名次提升9位,说明该模型在真实智能体任务上的可用性出现明显跃迁,而非仅参数或基准分数的变化。
AIHOT · X / 公众号精选/
6622
同一模型的两个推理配置同时进入前四,xHigh 与第 2 名只差 2 分,且 High 配置价格明显更低。相比 Sonnet 5,分数从 1540 提升到 1699,多个子项从第 30 多名跃升至第 4,说明其在 WebDev 细分能力上的位置发生了实质变化。
AIHOT · X / 公众号精选/
6623
模型Qwen 发布开源模型 Qwen3.8-2.4T-A95B
筛选线索开源模型与生态Agent 智能体AI 公司模型家族1 个独立信源
此前 Qwen-Max 级能力仅限闭源 API,本次 Qwen3.8-2.4T-A95B 将同类能力开源,使开发者可自行部署,降低了使用高性能模型的门槛,可能影响行业对开源与闭源模型的性能认知和选型。
Hugging Face Model Radar/
6624
此前图像生成与编辑通常需要分别部署模型或检查点,Qwen-Image-2.1 将两类能力合并到 7B 单检查点中,并支持最多 10 张参考图,意味着生成与编辑可以在同一模型内完成,模型部署和调用链路可能因此简化。
AIHOT · X / 公众号精选/
6625
变化集中在单位任务成本而非能力指标:若同一任务的平均花费持续下降,调用同等预算可完成的任务量上升,模型选型与定价谈判的参照点从单次调用价格转向 Cost per Task。GPT-6 Sol 相对 GPT-5.6 Sol 的差距,进一步说明这一指标在多代之间呈连续下行。
AIHOT · X / 公众号精选/
6526
这是 Gemini 4 Argon 在 Agent 类评测中的一次公开排名披露,Agent Arena 关注的是多步任务执行能力,与常规对话评测维度不同。净提升 +7.92% 与每任务 0.62 美元同时出现,说明排名提升伴随可量化的单任务成本,为后续比较不同模型在智能体场景下的性价比提供了参考点。
AIHOT · X / 公众号精选/
6527
相较 GPT-6 Sol (Max),新版本在价格不变的情况下分数提升 70 分、排名上升 4 位,且所有类目均有提升,说明同价位段的能力基线被进一步抬高,WebDev 场景的竞争位次随之变化。
AIHOT · X / 公众号精选/
6528
该模型将上下文上限拉到 1M,同时以约 560B 总参数、约 25B 激活参数控制推理成本,并提高线性 Attention 层比例。这使长任务处理在容量与效率之间有了新的折中方案,值得关注其对长上下文场景的实际可用性。
AIHOT · X / 公众号精选/
6529
此前 DeepSeek 的开源基础设施组件以英伟达平台为主,此次则把同一套组件体系搬到华为昇腾平台,形成一一对应的双平台布局。这为在昇腾上复现 DeepSeek 的模型训练与推理流程提供了可用的基础组件。
AIHOT · X / 公众号精选/
6530
模型GPT-6.1 上线 Agent Arena 评测平台
筛选线索Agent 智能体AI 公司模型家族1 个独立信源
与此前以静态问答或短任务为主的评测方式相比,这次把模型放进可调用搜索、文件系统与终端的真实长时程任务中,并让用户投票参与评估。评测场景从单轮回答转向多步骤工作流,考核维度更贴近实际使用中的智能体能力。
AIHOT · X / 公众号精选/
65