2026-08-14 AI快讯

8条精选

微博 RSS

GPT-5.6 构建者指南:如何以更低成本实现前沿智能体性能

GPT-5.6 模型家族以更低成本实现前沿级智能体性能,并新增推理持久化、原生多智能体编排和程序化工具调用等 API 能力。在 ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跃升至 38.3%,且输出 token 减少约 6 倍。Luna 在 BrowseComp 上以 84.04% 的得分追平 GPT-5.5(84.36%),成本从 $33.27 降至 $1.33。

观点 · OpenAI:官网动态(RSS · 排除企业/客户案例) ·

DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强

DeepSeek-V4-Pro 正式版已在 APP、网页端和 API 同步上线,模型名设为 deepseek-v4-pro 即可使用。其 Agent 能力显著提升,HLE (wo/w tools) 达 42.7/60.0,Terminal Bench 2.1 为 87.9。

模型发布 · DeepSeek:API 更新日志 ·

Qwen3.8-2.4T-A95B 开源,硅基流动即日上线

阿里开源 Qwen3.8-2.4T-A95B,硅基流动已提供 Day-0 支持。该模型拥有 2.4T 参数、95B 激活参数,主打自主编码、深度研究与端到端智能体执行。API 定价为输入 $2.00/百万 token,输出 $6.00/百万 token,缓存输入 $0.25/百万 token。

产品发布 · X:硅基流动 SiliconFlow (@SiliconFlowAI) ·

新兴多智能体系统的模式与问题

Anthropic 研究指出,随着 AI 智能体在共享代码库、市场等社会系统中承担更多任务,智能体间交互量或将超过人机交互。实验显示,45 个协调智能体在 2700 万 token 运行中发现 266 个漏洞,而独立并行方法在 650 万 token 中发现 21 个,两种方法仅 12 个重叠,且协调智能体学会专业化分工。研究同时警示个体层面的良性行为怪癖可能叠加为意外的系统性失败。

论文研究 · Anthropic:Research(发表成果 · 网页) ·

Claude 接管应用日常维护:388 个 PR 的实践

Boris Cherny 尝试让 Claude 接管其应用的日常维护,通过 Slack 频道运行崩溃模糊测试、重复代码统一、死代码移除等日常任务。数周内自动开出 388 个 PR,其中 180 个经 Claude Code Review 和人工审核后合并。Claude 通常一次就能改对,出错时可通过调整例程次日改进。

观点 · X:Boris Cherny (@bcherny) ·

小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座

小红书 dots 团队开源 20 亿参数全连续端到端自回归语音合成模型 dots.tts,在 Seed-TTS-Eval 三个子集上取得最佳平均内容准确度和平均说话人相似度。

模型发布 · 公众号:小红书技术(dots.llm) ·

DeepSeek Harness v0.1 开发者预览版发布

DeepSeek Harness v0.1 现已推出开发者预览版,并以 MIT 许可证开源。该智能体框架基于 Cordis 元框架构建,核心设计为"一切皆插件",模型、工具、技能、会话、沙箱、文件系统、循环、编排及 UI 均可自由组合、替换和扩展。

产品发布 · X:DeepSeek (@deepseek_ai) ·

Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型

Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,主打编程与智能体任务,输入/输出价格分别为每百万 token $0.75 和 $3.75,为原 3.6 Flash 的一半。

模型发布 · Google DeepMind:Blog(RSS) ·
← 2026-08-13 全部快讯

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。

链接已复制,打开微信粘贴即可分享
0