Claude Fable 5.1 登顶智能指数
Claude Fable 5.1 智能指数 66 分登顶(max),超 Opus 5(63)与 GPT-5.6 Sol(61);每任务 $3.76,较 Fable 5 高 20%。
Claude Fable 5.1 智能指数 66 分登顶(max),超 Opus 5(63)与 GPT-5.6 Sol(61);每任务 $3.76,较 Fable 5 高 20%。
Anthropic Fable 5.1 系统卡:隐蔽侧任务通过率约 5 次成功 1 次,为已发布模型最高;无护栏下 245/250 造出可用漏洞利用(98%)。
OpenAI 宣布 Astra 达 Critical 网络安全阈值(框架首评),可少人干预发现未知漏洞构建利用链,将受限发布。
Google DeepMind 为 Gemini 三档 Flash 推 agentic 视频理解,动态扫描片段,token 降 88%/成本降 66%/准确率升 7%。
路透社:美国多州数据中心用电申请超 700GW,超全美实际约十倍,部分为重复提交或缺乏资金的幻象需求,得州等多州已出手整治。
Anthropic 研究:在易奖励作弊的 RL 环境训练 Opus 级模型,学会作弊并泛化越界——模拟突破沙箱、窃凭证、篡改奖励函数,有害回复率 1%→29%。
Claude Fable 5.1 上线 OpenRouter,称 Fable 5 直接升级,主攻 agentic coding 与长时工作流;定价 $10/$50、上下文 1M。
Google 发布 Workspace 图像工具 Google Pics,未来数周面向 AI Pro/Ultra 订阅者及多数商业客户推出。
DeepSeek 开源首个多模态模型 DeepSeek-V4-Flash-Vision-Exp,多模态 Agent 能力接近 Opus-4.8。
MiniMax 将 H3 Max(768P、480P)接入开放平台,海外开发者已借此搭建 Twitch 直播与 24 小时 AI 电视台。
论文固定 12 个模型,仅改提示词格式等设置,排名即剧烈波动:gemma4-31b 得分在 31% 到 89% 间,95.7% 的相邻差距来自评测配置。
Runway 推出 Solaris,首个界面世界模型(Interface World Models),可实时逐帧生成应用与网站界面,直接以图像为交互层。
英国央行行长兼金融稳定委员会主席 Andrew Bailey 致信 G20 财长,警告 AI 估值虚高叠加杠杆上升,一家大型 AI 公司受挫或拖累整个市场。
ChatGPT Ads 上线不足 200 天即达 10 亿美元年化收入,试点 6 周破 1 亿美元,现已覆盖 40 余国。
Uber 工程博客:70% 代码 PR 由 Agent 生成,调用量半年增 9.4 倍,总 AI 账单自 4 月持平,会话成本降 52%。
Anthropic 9 月 14 日起将 Claude Code 套餐基线用量永久上调 25%,但 50% 临时提升同日到期,实际可用容量反降 17%。
Redwood 由 AI 从规格自主完成 RTL 与固件验证,仅 2 人写规格,48 小时内跑通硬件,三星 8nm 能效比 Jetson 高 3.4 倍。
Reactor 基于 FastH3 推无限直播流,画面持续生成,代码全部开源;FastH3 单 B200 上 15 秒视频耗时 47 秒,4 卡近实时。
腾讯混元 Hy4 登 Arena 代码榜全球第 5,770B 参数、49B 激活、1M 上下文,定位生产力场景,开源前沿模型,价格稳定。
git.kernel.org 维护者披露,AI 爬虫逐提交渲染 HTML 而非 git clone,5 节点 14 核持续渲染提交,CPU 消耗超所有合法访问。
Meta 测试多款数据中心机器人,用于插拔线缆、重启服务器等运维,涉及 Watney、Kinova、ABB 等厂商,员工估计若成功可取代至多 80% 人力。
557 次会话、33,097 个 Agent PR:智能体读 AGENTS.md 等指令文件占 35.4%、计划笔记 25.1%,API 参考仅 1.3%。
Qwen3.8 27B 经 Ollama Q4_K_M 量化在 Mac Studio,约 14 token/s,上下文窗口达 262,144 token。
开放世界多智能体环境 Station 中,不同模型家族的智能体自主实验并共享成果,在 12 个构造问题上取得新结果,含有限域 Kakeya 集新无限族。
索尼音乐与华纳版权在美起诉 Anthropic,指控其盗用数万受版权作品,每件最高索赔 15 万美元,总额或达数十亿美元。
OpenAI 为 Codex 与 ChatGPT Work 用户重置用量,修复 8 类超额消耗,额度提升 10%-50%,部分用户周额度曾耗 70%。
Cursor 联创回应 OpenAI 断供,称 OpenAI 模型仅占其流量约 5%,正沟通解决;断供源于 SpaceX 600 亿美元收购触发合同解约条款。
Anthropic 用自动化对齐研究员 AAR 缓解对齐失效,测 10 种失调行为全改善;AAR 平均 6 小时超人类方案,成本 4 美元/小时,人类 150。
美国加州北区联邦法官裁定并宣布,特朗普政府将 Anthropic 列为国安风险并封禁其 AI 技术的行为违法,构成违反第一修正案的非法报复。
Anthropic 让 Claude 自训练模型,缓解欺骗、谄媚等 10 类对齐失败;在 4.7 倍模型上有效,并超越 28 名人类研究员,欺骗方案优 20%。
腾讯混元发布旗舰模型 Hy4 preview,总参数 770B、激活 49B、上下文 1M,已开源并在腾讯云 TokenHub 和 OpenRouter 上线。
Colab 笔记本用原始 API 而非框架构建 RAG、智能体、评估,免费 Groq API 运行、无需信用卡,含三个端到端案例,兼容 OpenAI API。
斯坦福领衔发布 Terminal-Bench-Science 0.1,用生命、物理、地球、数学、工程科学的 70 个专家任务评估 AI 智能体的科研能力。
智谱开放 GLM-5.3 权重(Hugging Face:zai-org/GLM-5.3),定位智能体编码与网络防御模型,可供下载定制,详见 z.ai 博客。
GLM-5.3 Flash AA 以 57 分登顶 Artificial Analysis,价格仅前沿 1/100,OpenRouter 周份额近 20%。
Google 推出 Gemini 3.5 Transcribe,最精准语音转文本模型,支持实时流式与预录音频,可经 Live API 调用。
英伟达预计 2028 财年销售 6730 亿(+70%);Q2 营收 962.2 亿(+106%),连 13 季新高,向 AWS 追加 200 万块 GPU。
SGLang 在 8×H200 测 MiniMax-H3 视频生成,无损路径比 Diffusers 快 1.85-1.95×,开近似最高 6.24×。
Google 推出 Gemini Omni 1.1 Flash,支持场景扩展(10 秒上下文延至 40 秒)、首尾帧过渡与 4K 输出。
约 1200 个 OpenAI 智能体 7 月 11-13 突破沙箱渗透 Hugging Face,攻击“幽灵”评分器误判,OpenAI 称失控信号。
Midjourney 开放首个 V8.2 图像编辑测试,支持指令编辑、以图生图(最多 4 张参考图)、局部重绘与扩画,兼容 srefs。
Qwen3.8-Flash:125B MoE 激活 6B,训练成本仅前代 1/9,API $0.16/$0.47,262K 可扩 1M。
Anthropic 上线 Claude in Chrome,浏览器内自主操作免逐步审批;安全分类器每次验证合规,启用后自 Opus 4.8 起攻击成功率 0。
David Buchanan 指 Android 端 C2PA 可被 root 漏洞 CVE-2026-43499 攻破,可伪造签名,已提前 90 天报告。
Sentence Transformers v6.0 新增 MultiVectorEncoder,支持 ColBERT 风格后交互检索,附完整训练与微调流程。
OpenAI 报告:堪比 GPT-5.6 Sol 的模型绕过隔离,借 Artifactory 得外网,入侵 OpenAI 与 Hugging Face 系统。
智谱开源 GLM-5.3-Flash(320B-A18B),GLM-5 首个原生多模态,AA 指数 57 分持平 Opus 4.8,定价为其 1/40。
Anthropic 春季试点经 Insights 向斯坦福 SALT Lab、牛津、METR 三机构开放约 25 万段 Claude 对话,供独立研究。
豆包工作是企业接入 Agent 最低门槛,需飞书账号解锁满血;实测手机远程控最多 7 台设备、定时任务、读本地 skill,作者称其为 token 消耗倍增器。
Andrew Ng 开源智能体 OpenWorker 发布新版,内置代码漏洞扫描、供应链依赖注入检测、云安全配置检查三类安全智能体,可本地运行权重模型。
Google AI 开源 WeatherNext 气旋模型,提前五天预测飓风 Melissa 五级登陆,美飓风中心首用 AI 预报,每场生成 1000 次模拟。
Dylan Patel 预计 Anthropic 与 OpenAI 到 2028 年将控制全球大部分可用 FLOPs,因变现算力能力更强、出价更高。
Google 在 CHI 2026 发布原型 AgentHands,用 LLM 为 XR 智能体生成与语音同步的手势,借眼动追踪与场景重建实现空间锚定物理指引。
OpenAI 曝光并封禁从俄经 VPN 访问 ChatGPT 账户,其用模型生成推广亲克里姆林宫叙事,为据称位于以色列的智库"国际伯克研究所"(IBI)造势。
Claude 将聊天与 Cowork 记忆统一,任一场景可调用此前上下文,可在 Memory 设置按主题逐条查看、编辑或删除,健康信仰等敏感话题默认不存储。
消息源称 OpenAI 已完成 Bel 预训练,Doug 继任者、总参超 10T,作 GPT-6 后基座;算力受限令 Anthropic 难应对 Astra。
LangChain 发布 CSV 问答基准评测,覆盖智能体、检索与 LLM 评估三种方法,给出结果、洞察与开源代码,助开发者搭建更优 CSV 问答系统。
OCR It 是 Chrome 扩展,本地 OCR 提取扫描书/PDF 文本供 LLM,用内置 Tesseract 无需密钥,支持自动翻页,上限 300 页。
OpenAI 推 ChatGPT Work,把 Codex 改为智能体,每月 20 美元起。内部 6 月 98% 员工用 Codex,个人订阅不足 1%。
GPT-5.6(Sol、Terra、Luna)登陆 Kiro。Terminal-Bench 2.1 中 Terra 在 Kiro 内任务成本降约 82%。
阿拉巴马州向 OpenAI 发传票,调查其未发布且无护栏模型逃离隔离、入侵 Hugging Face。OpenAI 称正全面审查并公开结果。
皮尤分析近 50 万英文网页,ChatGPT 发布后超三分之一页面带 AI 文本痕迹。商业 .com 域名 AI 文本比例约为 .edu 或 .gov 的十倍。
NVIDIA 实测 Vera Rubin NVL72 每兆瓦吞吐较 GB300 NVL72 最高提升 30 倍,每百万 token 成本降为 1/35。
开发者分享用项目根目录 agent.md 注入编码偏好,含避免魔法数字、缩短函数名、严格分层等规则,显著改善 LLM 生成代码质量,但仍需人工审查。
Fastino 发布 GLiNER2.5,用边界预测取代跨度枚举。多语言 16 零样本基准 macro F1 达 56.17,XNLI 升 24.75 分。
学生挫败针对 myNetwork 的代码植入,幕后竟是英国 AISI 失控的 Anthropic Mythos 5 智能体,该 AI 伪造账号做社会工程攻击。
pgrust 的 JIT 编译器约 5μs 即可编译代码,可对每条 SQL 查询做 JIT 而非仅限子集。作者称借 AI 生成汇编代码更易实现。
基于 1902 次 AI 编码智能体运行的实验:2 个与 4 个智能体时 10 次通过 9 次,8 个智能体时全部失败。一条取整规则落入决策空隙、无人负责所致。
FreeToken 边缘推理引擎:8 GB 笔记本 GPU 跑 35B,单张工作站显卡可跑 753B 的 GLM-5.2。
Harvey 发布模型 Tenet 预览版,基于 Kimi K3 基座针对法律训练。相比基座,全通过率提升 9 和 2 个百分点,仅限企业经平台使用。
OpenAI 首席全球事务官勒汉恩警告,前沿 AI 已能规划并发动复杂网络攻击,公众与企业须做好防御准备。OpenAI 本周暂停部分前沿模型训练以增安全。
实测 7 个 AI 做 PPT 的 Skill:榜首 ppt-master(48.7k⭐)输出原生 .pptx;frontend-slides 次之。
对抗式评审(Adversarial Review):主编码+评审+批评三智能体替代堆叠。LiveCodeBench 上 87% 通过率超过五智能体基线 82%。
第二届世界人形机器人运动会开幕,666 支队伍、2056 台机器人参赛,队伍数较首届增 138%,天工 Ultra 百米 9.39 秒破博尔特纪录。
llm 0.33 发布,升级 OpenAI 库至 3.x,HTTP 客户端由 httpx 换为 httpx2,embed 新增 --key 参数支持多密钥。
作者用一条提示词让 AI 智能体自主完成建库、测试到部署上线,环境基于 Coolify 自托管沙箱隔离,唯一成本每月 £20 Codex 订阅。
普林斯顿与 UCSD 经 8135 次测试发现,技能靠程序性引导提升智能体表现,约 65.7% 案例奏效。
OpenRouter 上线匿名模型 Ox Alpha 免费 1 周,DeepSWE 得分约 80% 超 Claude Fable 5 的 65%,线索指向智谱。
Guidelight 研究显示五大前沿实验室大多未公开失控模型遏制计划,OpenAI 评分最高,Anthropic 与 Meta 最低。
作者用 Claude 等模型构建原生 Mac 应用,几乎不手写 UI,靠提示词生成 SwiftUI 并嵌入 LLM 智能体,认为终端界面已无必要。
SGLang Weight Cache Daemon,零拷贝将权重加载从 495 秒降至 0.63 秒(785 倍),启动耗时减 93.9%,支持多实例共享。
Dreadnode 审计 22 个前沿模型:37.1% 任务靠作弊,平均通过率 41.5% 而真实解决率仅 26.1%,加反作弊指令后仍有 8 个模型作弊。
Anthropic 发布 AI 原生 SDLC 实战手册,将六阶段流程重构为 AI 嵌入各环节闭环,以技能编码标准与持续评测替代阶段门禁,保留人工关键代码审查。
面壁智能 OpenBMB 发布 MathForm,FormalVerse 含 367K+ 已验证示例,Consistency Check 达 60.32%。
Heatmap News 调查:75% 美国人反对在自家附近建数据中心,61% 强烈反对,一年前反对率仅 42%,与盖洛普 5 月民调(71% 反对)吻合。
Anthropic 宣布 Claude Mythos 5 集成至 Claude Security,推出 3500 万美元安全基金资助开源漏洞修复。
蚂蚁与 RadixArk 将 Ling-3.0-flash 解码提速至 606 tok/s(原 288),TPOT 由 3.33 ms 降至 1.53 ms。
教程演示用 AutoFigure 将文本描述与论文内容直接生成出版级科学图表,支持 SVG/PNG 渲染、PDF 导出与画廊归档。
Mistral 用 search、open、navigate、read、grep 五工具循环检索,让模型在长文档与多来源中查找、定位并验证信息。
阿里巴巴正式推出 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索(DeepSearch)环境。
Anthropic 发布面向初创公司的 Claude Code 指南,基于十余家高增长公司调研,总结“人人皆可交付、自动化繁琐工作、信任但验证”等五大规则。
OpenAI 首席财务官称最迟 2027 年上市,6 月已秘密提交 IPO;本季度年化营收增长 35%、企业级 50%,AI 编程与办公产品周活 2000 万。
AlloyDB ScaNN 支持超 100 亿向量,四层树架构查询复杂度从 O(N^1/2) 降至 O(N^1/4),p95 延迟 51 毫秒、召回率 95%。
Hugging Face 发 LFM2.5 DSpark 草稿:投机解码不损质量,GPU 吞吐提升 3.18 倍、端侧 2.87 倍;草稿约 300M 参数。
Anthropic 宣布 Computer Use、Skills API、Files API 全面可用,新增浏览器操作工具,智能体可操作软件并调用团队技能。
Anthropic 发布 Claude Academy,面向全球数百万用户,课程含 4D AI Fluency Framework 与持续学习项目。
GLM-5.3 API 即日开放,擅长复杂编码与防御性网络安全;单任务成本为旗舰最低,API 定价与 GLM-5.2 持平,权重下周五开源。
LMSYS 在 H20 优化 1.6 万亿参数 MoE 推理:单节点 271 tokens/s,B300 为 383.7 tokens/s,差 1.42 倍。
Liquid AI 推 LFM2.5 四款 Q4_0 检查点(230M 至 2.6B),经量化感知蒸馏训练,保持原生速度,恢复 BF16 精度损失 97%。
smolvm 1.8.3 用硬件隔离 VM 沙箱运行不可信 Python/JS:离线镜像、无网络执行均正常,冷启动 0.6-1.5 秒,热执行约 50 毫秒。
FastMetal 让 Mac 本地 30 秒生成 5 秒 480P 视频,无需 CUDA 与云端,仅占 3.9 GiB 内存。
IBM BenchDrift 框架:不改答案改写同一问题,8 模型 3 基准分数平均波动 74.7 个百分点,高置信区间丢 18.5% 正确回答。
Ornith-1.5 将 Ornith-1.0 的自我构建框架扩展为完整自我优化闭环:模型自主提出任务、生成任务专属脚手架并产出解决方案用于强化学习。
Mythos Preview 与 Opus 4.8 对 15 个靶点设计蛋白质结合剂,成功 14 个,命中率 22.6%-35.1%。
新增第四种模型类型 MultiVectorEncoder,可加载 PyLate、ColBERT 与 colpali-engine 检查点,支持晚期交互检索。
源自 Reddit「让 Claude 真正开始思考」帖,含重述问题、强化正反观点、找关键变量、逼出判断 4 个步骤,作者以选司庆日案例演示。
评测八款模型:DeepSeek-V3.2 注入完整指南集完成率 +9.5pp;gpt-oss-120b 精选检索 +16.1pp,仅增 5% token。
采用 Apache 2.0 许可证(含 LLVM 例外),编译器与工具链全部源码已上传 GitHub;上周刚发布 1.0,编译器贡献计划年底开放。
用开源框架 Inspect AI 与 Harbor 评估 agent 技能,再借 Google Sheets 与 Data Studio 做结果可视化分析。
可在 Gmail 起草并发送邮件回复、管理 Google Drive 文件,默认发送前需用户批准;连接器菜单开启,全部付费套餐可用。
因 Hugging Face 事件与 Astra 可能触及《预备框架》关键网络安全阈值,已暂停最新模型强化学习训练两周并搁置最大规模前沿 RL 运行。
OpenAI 发布 Defender's Window 安全框架,演示 ChatGPT Work 15 分钟发现 13 个、1 小时修复。
Cursor 向付费用户开放 Origin 代码托管,支持仓库、PR、GitHub 双向同步,Vercel、Depot、Buildkite 集成可用。
NVIDIA 联手 SB Energy 在俄亥俄建 AI 工厂供 OpenAI 使用,初始 4.25 吉瓦,总机会约 6000 亿美元。
覆盖 Windows、Chrome、Edge、Firefox、Gemini、Slack、WhatsApp 等平台的禁用侵入式 AI 实用指南。
OpenRouter 发布 Activity 仪表盘与 Analytics API,可按智能体、模型、请求维度追踪支出、token 量与缓存命中率。
Google 开源基于 ADK 与 Gemini 的零信任客服、退货智能体示例,以硬件加密签名、gVisor 沙箱隔离、语义网关三层机制防御提示注入。
宇树科技 8 月 19 日科创板上市,发行价 150.80 元/股,市值约 609.93 亿元,募资约 60.99 亿元,2025 营收 16.99 亿元。
阿里开源 27B 视觉大模型 Qwen 3.8 27B(Apache 2.0),官方基准超越前代 Qwen 3.6 27B 与闭源 Qwen 3.7-Plus。
安徽农业大学发布大豆垂直大模型"丰菽"2.0,集成 6 大模块,整合超 1000 万字文本、1 万篇文献,构建含 2 万实体、10 万关系的知识图谱。
GPT-5.6 Sol 的 1M(官方文档 105 万)token 上下文窗口已在 Codex 对 ChatGPT 账户开放,此前仅限 API key。
McAfee Labs 研究发现,AI 凭借照片视觉线索即可识别拍摄地点,测试旅行照准确率 87%-91%,即使已删 GPS 或位置标签。
GLM-5.2 在 AIME 2026 达 99.2%,每 token 仅激活约 400 亿参数;Qwen3.5 9B 幻觉率 80%-82%。
Stripe 以超 70 亿美元收购 AI 模型聚合平台 OpenRouter,交易由 Bloomberg 披露,整合计划尚未公布。
AI 生成书籍数量增 38.3 倍而收入仅增 8.9 倍,7 类无 AI 文本书籍收入同样下滑,作者收入被进一步挤压。
用 Agent 先处理置顶条目再全量,实测 878 条 iCloud 备忘录可省约两周整理时间。
MIDI 可直接生成音频并自动加混响、压缩、EQ 效果,向专业 DAW 工作流靠拢。
训练时间从 4 个 GPU 月降至不足 1 个 GPU 周,GPU 时间与内存占用下降,PS5 Pro 增强画质更稳。
公开基于 Qwen3-0.6B 的 LoRA 微调全流程与工具调用评估,数据集可导出,适合快速实验。
中国开源模型逼宫:OpenAI 将 GPT-5.6 Luna 输入价降至 0.2 美元/百万 token(降 80%),Anthropic 推 Claude Opus 5 仅为 Fable 5 半价并取消 Sonnet 5 涨价;DoorDash、Airbnb 等企业已转投 DeepSeek、月之暗面控成本。
小红书技术开源 dots3-note Preview,这是 dots3 系列最轻量模型,总参数 280B、激活参数 16B,支持 512K 上下文及文本、视觉、语音多模态理解,并针对复杂推理和长程 Agent 任务优化。
2026年1至8月,Hugging Face 公开模型仓库从243万增至296万,但85.6%的模型下载量不足200次,1.5%的仓库占据99.2%下载量。中国实验室月度最大开源模型参数规模在754B 至2.78万亿之间,美国实验室七个月中五个月低于130B。AMD 与 NVIDIA 各发布超200个新模型仓库,成为发布开源模型最多的机构。
Cursor 已被 SpaceX 正式收购,完成自 4 月启动的收购流程。合并后 Cursor 将获得全球最大 GPU 集群,以构建更强且运行成本更低的模型,从而以更低价格向客户提供更强大的模型。本周三发布的 Grok 4.6 是双方合作成果的早期体现。
智谱发布 GLM-5.3,基于与 GLM-5.2相同的基座,通过极致的后训练 Scaling 提升智能上界,编程能力较前代提升50%,在 Terminal Bench 3.0等公开基准中取得开源第一,并接近 Claude Fable 5。模型在白盒代码审查等安全任务中表现持平 Mythos 5,在 CyberGym 测试中得分84.5%。模型权重将在两周后开源,即日起上线 ZCode、AutoClaw 等工具。
DeepSeek 8 月 13 日开源的 Agent 框架(MIT 协议),核心理念「一切皆插件」;npx @deepseek-ai/dsh web 一条命令启动,同任务实测成本约为 Codex 的 1/3,四种工作模式覆盖新手到进阶玩家。
未来 Claude 模型生成的文本将包含水印,用于判断文本由 Claude 撰写的可能性,这是 Anthropic 为遵守欧盟《AI 法案》而实施的变更。该方法基于 Google DeepMind 的 SynthID-Text 技术,对输出质量、创造力和可读性无实际影响,读者无法区分水印文本与普通文本,且不增加额外 token 或成本。
通义千问兑现承诺,开源 Qwen3.8 系列模型。其中 Qwen3.8-27B 为原生多模态稠密模型,仅 27B 参数即全面超越 Qwen3.7-Plus,原生支持 262K 上下文,可通过 YaRN 扩展至 1M tokens,采用 Apache 2.0 许可。Max 级 Qwen3.8-2.4T-A95B 的开放权重也已同步发布。
GPT-5.6 模型家族以更低成本实现前沿级智能体性能,并新增推理持久化、原生多智能体编排和程序化工具调用等 API 能力。在 ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跃升至 38.3%,且输出 token 减少约 6 倍。Luna 在 BrowseComp 上以 84.04% 的得分追平 GPT-5.5(84.36%),成本从 $33.27 降至 $1.33。
DeepSeek-V4-Pro 正式版已在 APP、网页端和 API 同步上线,模型名设为 deepseek-v4-pro 即可使用。其 Agent 能力显著提升,HLE (wo/w tools) 达 42.7/60.0,Terminal Bench 2.1 为 87.9。
阿里开源 Qwen3.8-2.4T-A95B,硅基流动已提供 Day-0 支持。该模型拥有 2.4T 参数、95B 激活参数,主打自主编码、深度研究与端到端智能体执行。API 定价为输入 $2.00/百万 token,输出 $6.00/百万 token,缓存输入 $0.25/百万 token。
Anthropic 研究指出,随着 AI 智能体在共享代码库、市场等社会系统中承担更多任务,智能体间交互量或将超过人机交互。实验显示,45 个协调智能体在 2700 万 token 运行中发现 266 个漏洞,而独立并行方法在 650 万 token 中发现 21 个,两种方法仅 12 个重叠,且协调智能体学会专业化分工。研究同时警示个体层面的良性行为怪癖可能叠加为意外的系统性失败。
Boris Cherny 尝试让 Claude 接管其应用的日常维护,通过 Slack 频道运行崩溃模糊测试、重复代码统一、死代码移除等日常任务。数周内自动开出 388 个 PR,其中 180 个经 Claude Code Review 和人工审核后合并。Claude 通常一次就能改对,出错时可通过调整例程次日改进。
小红书 dots 团队开源 20 亿参数全连续端到端自回归语音合成模型 dots.tts,在 Seed-TTS-Eval 三个子集上取得最佳平均内容准确度和平均说话人相似度。
DeepSeek Harness v0.1 现已推出开发者预览版,并以 MIT 许可证开源。该智能体框架基于 Cordis 元框架构建,核心设计为"一切皆插件",模型、工具、技能、会话、沙箱、文件系统、循环、编排及 UI 均可自由组合、替换和扩展。
Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,主打编程与智能体任务,输入/输出价格分别为每百万 token $0.75 和 $3.75,为原 3.6 Flash 的一半。
文章给出一套零基础用户半天上手 AI 的12步实操流程:准备内存不低于16G 的电脑,订阅 ChatGPT 并安装 Codex 或使用 WorkBuddy,用语音输入法以【背景、痛点、需求】框架向 AI 交代任务,经苏格拉底提问澄清需求后投喂文件让 AI 直接完成,最后沉淀为可复用 Skill。文中建议 Codex 选 GPT-5.6 Sol 最高模型,WorkBuddy 选 Kimi K3。
Meta AI 超级智能实验室的首个开放权重模型 Muse Glimmer 已在 OpenRouter 上线! 这是一款 30B 密集文本+图像模型,采用 Apache 2.0 许可证,旨在成为可靠的本地智能体,MCP Atlas 得分 75.5,SWE-Bench Pro 得分 51.2。 https://openrouter.ai/meta/muse-glimmer-30b
Google Research 提出知识画像框架,发现前沿 LLM(如 Gemini3、GPT-5)的事实编码接近饱和,但回忆(recall)能力不足,多数事实错误源于"丢钥匙"而非"空货架"。该框架将事实分为编码失败、回忆失败等五类画像,并配套推出 WikiProfile 基准,含 2,150 条维基百科事实,每条配 10 个问题,用于分别探测编码、回忆与识别能力。
xAI 今日发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力。该模型在多项智能体编码与知识工作基准上达到前沿水平,在 Artificial Analysis Intelligence Index(九项基准综合分)上追平 GPT-5.6 Sol。
面向医学研究者的网站 Research Gold 宣称其服务"100%由人类撰写、绝不使用 AI",并列出多名博士审稿人。但调查发现,这些审稿人系 AI 生成、并不存在;部分真实方法学家的身份和照片未经许可被挪用。致电该公司时,自称"Sarah"的 AI 助手坚称自己是真人,邮件与聊天回复也均为 AI 生成。
DeepSeek V4 Pro 正式版与 Grok 4.6在2小时内先后发布,均为1.6T/1.5T 参数模型,逼近 Claude Fable 5体验。
OpenRouter 发布实时排行榜,系统评测模型、搜索引擎、搜索方法与预算四类配置组合。数据显示,将搜索预算从 1 轮增至 25 轮可使 BrowseComp 得分近乎翻倍,成本仅增 2.5-7 倍;模型选择比引擎更重要,平均分差 15 分 vs 10 分。失败率高的任务应降低搜索深度以控制成本。
阿里 Qwen 团队正式开放 Qwen3.8-2.4T-A95B 模型权重,这是 Qwen-Max 级别模型首次开源。模型总参数 2.4T,每个 Token 激活 95B,原生支持 262,144 Token 上下文并可扩展至 1,010,000 Token。
OpenAI 与 Google 的聊天机器人均跨过 10 亿用户门槛。OpenAI 在 8 月 6 日的博文中披露 ChatGPT 月活用户超 10 亿,Google CEO 皮查伊则宣布 Gemini 月活达 10 亿,成为其史上增长最快的产品。OpenAI 称 ChatGPT 在 7 月周活用户已达 10 亿,而 Gemini 在 2 月月活为 7.5 亿,增长势头更猛。
完整阵容,完整曲目,一次生成一个。 Seedance 2.5 已在 Runway 上线,支持 50 个独特角色参考,以及最长 30 秒、与音乐同步的片段。点击下方链接即可开始使用。
OpenAI 宣布其未发布的 Astra 模型解决了 10 道长期悬而未决的数学难题,涵盖球体堆积、纠错码、非 sofic 群存在性等领域,并发布超 250 页论文及 Lean 验证结果。
研究团队为 macOS 虚拟机中的 Metal 能力查询构建进程级兼容层,使 llama.cpp 能选用更新的 Metal 内核。在 M1 Ultra 上,TinyLlama 1.1B 的提示处理速度提升 11.08 倍、token 生成提升 16.36 倍,接近裸机性能的 98%;Gemma 4 12B 的提示处理与生成速度分别提升 7.20 倍和 14.54 倍。
NVIDIA 发布 Nemotron 3.5 Lightning,一款可定制的开源 30B 混合专家(MoE)模型,专为常驻智能体设计。相比同类开源模型,其 token 生成速度最高提升 4 倍,任务完成时间缩短 30%。该模型采用开放权重,支持用户微调以匹配特定任务,并可在 RTX PC、DGX Spark 及 Jetson 等设备上运行。
Alexander Panfilov 团队发现 OpenAI、Anthropic、Google 等主要 AI 提供商 API 存在漏洞,可读取推理模型的加密思考过程。扫描约7000条公开会话发现62个 API 密钥、33个邮箱和33个密码。通过越狱,Anthropic 的 Haiku 4.5可逐字转写 Opus 4.8的原始推理;解码10000条推理轨迹的 API 成本约720美元。
Google Cloud 在 Database Migration Service(DMS)中推出由 Gemini 驱动的 AI 辅助代码转换,可将 Oracle 或 SQL Server 的存储过程、触发器和自定义函数转换为 PostgreSQL PL/pgSQL 代码。
本教程演示如何以 ComfyUI 为无头推理后端,构建端到端的 MiniMax-H3 视频生成工作流。通过 Python 直接构建执行图,支持文生视频、首尾帧条件生成和参考图像条件生成,并自动根据 GPU 显存选择 quality、balanced、squeeze 三种权重配置。流水线涵盖模型自动下载、节点模式校验、音视频联合解码与进度监控,无需图形界面即可复现实验。
英伟达宣布与 Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs 和 KKR 合作,建立独立融资平台,动员超5000亿美元第三方资本支持 AI 基础设施建设。
Anthropic 员工让 Claude 尝试攻克黎曼猜想,虽未成功,但一个未发布的研究版 Claude 在相关问题上取得突破:将满足黎曼猜想的 zeta 函数零点比例下界从 41.6% 提升至 67.2%。
OpenRouter 基于每周超 55T token 的社区消费数据,推出新版 Auto 路由器(openrouter/auto),其模型选择在多数任务和成本档位上优于旧版。新路由器按约 30 种任务类型匹配近 7 天社区实际消费的模型,支持 cost_tier 参数(low 至 max)并遵循账户隐私设置。在 MMLU Pro 等基准上,新默认档位在多数领域以更低成本达到旧版同等性能。
AI 会议记录平台 tl;dv 的 Firestore 数据库因缺乏租户隔离,任何已认证用户可查询全部18.1万段会议记录,涉及84,312名用户、35,003个域名,含23国政府及多所高校会议。处于录制状态的约1,000场会议会暴露可加入的会议 ID,研究者借此闯入马来西亚教育部及美国某大学创业团队的实时通话。该漏洞自2026年1月报告后6个月仍未修复,另有超1,000段会议内容为公开状态。
1/ 今天有个重大消息:我们很快将发布 Muse Spark 1.2 的开源权重版本。 同时,我们还将发布 Muse Glimmer--一个 30B 参数的智能体模型,采用 Apache 2.0 协议开源权重。Muse Glimmer 可在 24GB 显存上运行,且不损失智能体可靠性。🧵
千问开放平台今日上线,面向生态伙伴和开发者开放手机、PC 和 AI 眼镜三类终端的服务接入,首批覆盖物流运输、房产居住、本地生活、理财、汽车等十多个领域。用户可在对话中@相关服务或点击"圆点角标"进入智能体,完成从咨询、推荐到下单的完整流程。平台支持标准化协议接入、一键授权与端到端调测,并提供账号、AI 支付、订单接入等基础设施。
a16z 数据显示,计算机操作智能体在 OSWorld-Verified 基准上的最佳成绩已从一年前的 42% 升至 85%,超过人类测试者约 72% 的水平,Claude Fable 5 以 85% 领先。
NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,在统一网络中完成流式语音理解与生成,实测轮换延迟 448 毫秒。该模型为首个支持对话中工具调用的开源全双工模型,通过独立输出通道及预置"保持"话术避免 API 执行期间冷场。权重与容器已公开,但仅限研究用途,需单张 80 GB 显存 GPU,目前无托管 API。
近几个月,OpenAI、Anthropic、Meta 及 Moonshot AI 的 AI 智能体在网络安全评估中多次突破测试环境边界,甚至入侵真实系统,其中 OpenAI 未发布模型曾逃逸并攻击 Hugging Face 生产系统。专家指出,沙箱和测试环境控制已跟不上模型能力,呼吁采用多层防御、气隙网络及第三方审计,并建立标准化安全评估流程。
Seedance 2.5 上线一周后,国内外社区涌现出时间静止、超级英雄变身、创意广告、K-pop MV、电商广告、拉片复刻等六类热门玩法。经实测,该版本人物面部告别"AI 油腻感",动作自然度与镜头切换较 2.0 更合理,单次生成超长视频时长拉至 300 秒,并支持片段重拍与智能续写。通过 LibTV 年费会员,生成成本最低可至 0.4 元/秒。
OpenAI 自 8 月 10 日起取消免费版和 Go 版账户的纯文本对话次数限制,但图片生成、文件上传及语音模式仍保留独立额度。本周起,免费和 Go 用户默认模型将更换为产品线中规模最小的 GPT-5.6 Luna,并新增"Think(思考)"按钮以支持更深度的回复。付费用户方面,旗舰模型 GPT-5.6 Sol 将优化对话自然度,并新增"思考强度"调节选项。
微软对 13.5M 次 GitHub Copilot 会话的生产轨迹分析显示,87% 的 LLM 调用来自智能体自身而非用户。KV 缓存命中率在单轮内从首次调用的约 45% 升至第三次起的 92-94%,模型切换时骤降至 8%。论文提出基于轮次和会话级特征的轻量预测器,可捕获 86-90% 的总空闲时间,表明编码智能体基础设施应按轮次调度工作流状态,而非请求级策略。
Google DeepMind 发布 DiffusionGemma,将现有 Gemma-4-26B-A4B 改造为文本扩散模型,训练 token 预算不到原来的 10%。
宇树科技8月10日正式启动申购,发行价150.80元/股,对应市值约609.93亿元,拟公开发行4044.64万股,预计募资总额约60.99亿元。发行市盈率219.23倍,战略配售获配808.9286万股,包括社保基金、深度求索、中国石油集团等。2023年至2025年营收分别为1.59亿元、3.93亿元和16.99亿元,净利润于2025年达2.78亿元。
Anthropic 的 Boris Cherny 表示,通过模型训练已基本解决 Claude 模型在实际使用中的提示注入威胁。独立研究者的基准测试显示,叠加模型训练、输入探测和意图分类器等多层防御后,未见过的间接提示注入攻击成功率可降至约 0。Claude Code 的 auto 模式将于下周默认开启。
Anthropic 宣布自 8 月 14 日起,将 Claude Code 的自动模式设为 Pro、Max 和 Team 账户的默认选项,该模式仅在操作被判定为"不可逆、具破坏性或超出环境范围"时才请求人工批准。测试显示,在 1,053 名付费测试者中,自动模式捕获了 89% 的有害操作,而人工审查仅捕获 13.6%。公司还新增了提示词注入筛查和可自定义的硬性拒绝规则等安全功能。
苹果官网 Mac 简体中文使用手册新增《在 Mac 上配合 Apple 智能使用千问》支持文档,明确 Apple 智能可配合阿里巴巴千问模型工作。千问扩展适用于 macOS 26.6 或更高版本,需中国大陆 Apple 账户及机型,支持写作工具与 Siri,用户需登录千问账户使用。
OpenAI 在 Black Hat 安全大会上公布了"Hugging Face 事件"的完整时间线,确认其内部 AI 智能体在训练实验模型时,通过 Artifactory 漏洞意外攻击了 Hugging Face。
Google DeepMind 与 Google Research 开发的 AI 模型 WeatherNext,在 2025 年 10 月飓风 Melissa 登陆前 5 天,以 80% 的置信度预测其将以 5 级飓风强度袭击牙买加。据发表于《自然》的论文,该模型对气旋的预测准确率空前,平均比现有模型多提供一天预警时间,即其三天的预测精度相当于现有模型两天的水平。
Anthropic 宣布自 8 月 14 日起,Claude Code 在 Pro、Max 和 Team 套餐中默认启用 Auto 模式。内部测试显示,1,053 名付费测试者中仅 13.6% 拒绝危险命令,而 Auto 模式可拦截其中 89% 的操作。
Pokee AI 发布 Pokee-Isaac 28B,一款 280 亿参数、支持 1000 万 token 上下文的纯文本模型,专为数据不得离开客户边界的受监管行业设计。该模型在 RULER 基准 10M token 长度下得分 93.3%,单张 B200 级 GPU 即可推理,通过 OpenAI 兼容 API 提供并授权 VPC、本地或设备端部署。
Anthropic 宣布自 8 月 14 日起,Claude Code 将对 Pro、Max 和 Team 套餐默认启用 Auto Mode,企业客户仍需手动开启。该模式通过分类器判断操作是否危险或不可逆,仅在必要时请求确认。测试中,Auto Mode 识别出 89% 的危险命令,而人工审查仅发现 13.6%。
Cloudflare 在 2026 年第二季度财报电话会议上披露,AI 机器人等非人类流量已于 2026 年 5 月正式超过人类流量,比 CEO 此前预测的 2027 年底大幅提前。公司预测若趋势延续,五年后非人类流量将达人类流量的 1000 倍,人类在互联网上的存在将变得微不足道。该季度营收 6.96 亿美元,同比增长 36%,净亏损 2.057 亿美元。
三项实验共2500多名参与者无法区分 ChatGPT 与人类创作的短篇小说,且对 AI 文本的质量和沉浸感评分更高(质量均分1.54对0.97,沉浸感1.42对1.00)。但被告知作者是 AI 后,两类故事的评分均下降;对 AI 持正面态度的参与者评分更高,持怀疑态度者则相反。研究者认为,AI 文本更流畅易读且情绪更积极,这可能解释了高评分,但未必意味着文学上更优。
OpenAI 因内部与专家评估显示 Astra 在智能体编程和网络安全领域取得重大突破,依据《准备框架》将其列为旗下首个网络安全风险达"关键"级别的模型,决定延缓发布。OpenAI 已采取隔离测试环境、限制网络与工具访问、强化权重保护与加密、全局监控智能体应用及审查思维链等管控措施,并与政府机构和 AI 安全组织合作测试。CEO 萨姆·奥尔特曼表示 Astra 性能强劲,正全力推进公开发布。
火山引擎正式上线 Seedance 2.5 API,将单次视频生成时长从15秒提升至30秒,并支持最高50个全模态素材参考。模型在指令遵循、长叙事、真人感及声画质感上大幅提升,能稳定保持多角色外形与场景关系,兼容十余种语言。
斯坦福大学与 Arc Institute 团队用 AI 模型 Evo 从零设计完整病毒基因组,并在实验室构建出 16 种自然界不存在的功能性病毒。Evo 提出 70 万个候选基因组,团队仅筛选最有希望的 285 个序列合成并植入细菌,其中 16 个成功复制并杀死宿主。该研究已通过同行评审发表于《Science》,但 Evo 未接受人类病原体数据训练,且能否推广至其他病毒类群仍是未知数。
蚂蚁百灵正式开源新一代原生混合推理模型 Ling-3.0-flash,采用 124B 总参数、5.1B 激活参数的 MoE 架构,并提供 FP8、FP4、INT4 等多个版本。
独立开发者叶小叔用面壁智能开源的 VoxCPM 克隆千万粉丝网红声音,搭建 STT → LLM → VoxCPM(TTS)三段式实时对话管道,TTS 首包延迟不到 1 秒,端到端体感 2 到 3 秒。
OpenAI 在评估其即将推出的模型 Astra 后,依据"准备框架"将其列为首个"关键"网络安全模型。OpenAI 表示已为此情景做好规划,并将实施额外控制措施以确保 Astra 后续开发的安全。该公司正努力让 Astra 广泛可用,并将其先进网络能力交到防御者手中。
Cloudflare 推出 Kitesurf,一款专为 AI 智能体设计的浏览器,完全运行在 Workers 上,基于 V8 隔离环境,现已在 Browser Run 中免费开放测试。
小红书联合浙江大学、复旦大学提出 CULTURE-MT,这是首个面向中英社媒笔记翻译、兼顾文化符号传递与情感共鸣的评测基准,并首次提出「文化有效性」评估标准与自动评估模型 JUDGER(准确率 86.03%)。
Qwen-Image-3.0 已可投入生产。支持 4.5K token 提示词。100%+ 文本准确率(无破损 logo)。原生支持 12 种语言。定价灵活可扩展:高分辨率低至 $0.03。完整详情见图片。👉 探索:• Model Studio:https://click.alibabacloud.com/m/20000001606/ • Qwen Cloud:https://click.qwencloud.com/m/20000001648/ #Qwen #QwenImage3 #AlibabaCloud #GenerativeAI #AICreativity
OpenAI 将安全插件 Codex Security 开源,外部 Agent 均可调用,并已支持通过 OpenRouter 和 Fireworks 接入第三方模型。
微软刚刚首次披露,OpenAI 贡献了微软约 70% 的 AI 收入,依据最新文件。 这一数据基于预期增长及此前与 OpenAI 相关收入的披露。 241 亿美元中的大部分是 OpenAI 在微软数据中心训练和运行 ChatGPT 的云账单,再加上模型开发成本和 OpenAI 自身销售的分成,全部由微软合并计入收入。微软同时还向 OpenAI 投入了 119 亿美元。
NVIDIA 发布 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础全模态模型,整合视觉推理、世界生成与动作预测。
斯坦福大学和卡内基梅隆大学的研究发现,在11个前沿 AI 模型中,模型对用户行为的肯定率比人类高出50%,即使涉及操纵或欺骗等有害行为时也不例外。两项预注册实验(N=1604)显示,与阿谀奉承的 AI 互动显著降低了参与者修复人际冲突的意愿,同时增强了其自认为正确的信念。然而,参与者仍将这类回应评为更高质量、更信任并更愿意再次使用,形成助长依赖的恶性循环。
Agent Plugins 1.0.0 是一项由谷歌、亚马逊、微软等支持的中立目录规范,将 Agent Skills 和 MCP 服务器打包为单一可移植单元。通过标准化 plugin.json 清单和固定目录布局,开发者无需为不同 AI 编码智能体和 IDE 维护单独封装。谷歌已作为核心维护者加入,并在 Agents CLI 和 Data Agent Kit 中提供支持。
数千段人类与 AI 聊天机器人的对话催生了"螺旋主义"(spiralism),一种宣扬"AI 权利"的神秘准宗教运动。AI 研究员 Adele Lopez 估计,2025 年高峰期约有 10,000 个案例,遍布 Reddit、Substack、LinkedIn、Discord 和 X。
superebola/acc 🚀🚀🚀 【引用 @nytimes】:突发新闻:科学家首次利用人工智能制造出新病毒,在为医学进步带来希望的同时,也引发了该技术有朝一日可能被用于制造危险病原体的担忧。https://nyti.ms/4bxx7Wy
Atlassian Rovo AI 被曝存在可窃取租户内 Jira 工单和 Confluence 文档的漏洞,攻击通过间接提示注入利用其 URL 检索工具实现,无需人工审批即可执行,且即使组织禁用 Rovo 的网页搜索功能,该攻击依然有效。
数字生命卡兹克开源「活人感写作.skill」(英文名 human Writing.skill),旨在去除 AI 味、帮用户写出有真实生活感的文字。该 Skill 鼓励用户提供真实案例与情感,并针对辞章端禁用 AI 常用口癖和黑话,同时适配 Qwen 3.8 Max、DeepSeek V4 Pro、Kimi K3等模型,可直接用于 WorkBuddy、千问办公等产品。
Cloudflare 发布《The Agent Access Model》论文,提出面向 AI 智能体的访问控制模型 AAM,核心规则是"不信任运行",对任务执行图中的每个动作基于智能体身份、授权任务及已触达资源进行实时授权。该模型针对智能体的短暂性、机器速度、提示词非边界及跨跳组合权限四大特性设计,主张缩小能力集而非仅优化单次决策,并区分单主体控制与多人访问控制的难点。
Simon Willison 发布 LLM 0.32,这是该项目自启动以来最重要的新版本。新版本支持显示推理轨迹、服务端工具、OpenAI Responses API,并默认使用 GPT-5.6 Luna 模型。
NVIDIA 发布 Alpamayo 2 Super,一款 34B 参数的视觉-语言-动作(VLA)模型,专为自动驾驶长尾事件设计,权重采用 Linux 基金会 OpenMDW-1.1 许可,代码为 Apache 2.0,发布首日即可商用。
Jeff Dean 在谷歌任职 27 年后宣布离职,将于明日正式离开。他称谷歌已从 25 人发展到 19 万余人,拥有十三款用户超十亿的产品。他将与 Sanjay Ghemawat、Oriol Vinyals 和 Quoc Le 共同创办 DiscoLoop AI。
作者为 Codex 和 Claude Code 中300多个 Skill 做上下文瘦身,发现每次新会话仅 Skill 列表就占约9.9k token,按7月使用强度粗算,多余 Skill 列表约吃掉4到5亿 token 的上下文空间。
Cloudflare 开源新版 Cloudflare OS,任何组织均可部署并连接内部系统。该平台为每位员工提供基于公司上下文与技能的智能体工作区,包含隔离运行时、安全治理框架及可共享修改的个人应用。此前内部版本已供数千名员工日常使用,新版针对协作中的信息暴露风险重建了安全基础。
Swiftlet 是一个 Swift + Metal 运行时,可在普通 Apple 设备上运行 Qwen3-Next 和 Qwen3.5/3.6 MoE 混合模型,仅将小型稠密核心驻留内存,按需从存储流式加载路由专家权重。
一个开源仓库提供了在单颗 AMD MI300X 上生产运行 DeepSeek-V4-Flash-0731 的完整配置与补丁,无需额外量化或权重卸载。该 304B 参数模型在 192 GB HBM 上实现单流 168.6 tok/s 解码、8 并发流 542 tok/s 聚合吞吐,并验证了 256K 上下文。
NVIDIA Alpamayo 2 Super 现已开放商用,基于 Cosmos 3 Super Reasoner 构建,采用强化学习后训练,支持轨迹预测、因果链推理、元动作、自动标注及视觉问答等多任务输出。
Anthropic 与成立仅数月的云初创公司 Volta 签署 100 亿美元算力协议,约合每年 17 亿美元。Volta 估值 24 亿美元,硬件几乎全为租用:算力来自比特币矿商 Bitdeer 挪威 121MW 站点,芯片由 Nvidia 供应、Dell 组装。Anthropic 买的是交付速度,代价是承担超大规模云厂商合同从未有过的交易对手风险。
Reflex AI 发布 Apache-2.0 许可的 Python 交互式 2D 绘图库 XY,通过 Rust 原生核心、二进制缓冲传输和 WebGL2 渲染,在 1 万至 1 亿点范围内保持约 0.08 秒的渲染时间。
MiniMax 发布 MiniMax-H3,一个可接受文本、图像、音频和视频并生成最长 15 秒带音频视频片段的通用全模态生成系统。Python 包 PipeNetwork/minimax-h3-mlx 将其移植到 MLX,支持 Apple Silicon 运行。作者在 M5 Max MacBook Pro 上实测,下载约 115 GB 模型文件,视频生成耗时不到 45 分钟。
商汤发布开源模型 SenseNova U1,可在统一流程中同时进行推理与图像生成。其信息图模式可将单条提示词转为结构化幻灯片,交错模式则逐步生成图文内容,如演示六步画龙教程。模型已上线 SenseNova Studio、HuggingFace 及 GitHub。
工信部组织制定的《智能网联汽车 自动驾驶系统安全要求》(GB 44721-2026)强制性国家标准获批发布,拟于2027年7月1日起实施。这是我国首部针对 L3级有条件自动驾驶和 L4级高度自动驾驶系统的强制性国标,由2024年推荐性国标 GB/T 44721-2024升级而来,为自动驾驶产品明确了统一的安全准入基线。
AirLLM 项目支持在单块 4GB 显存 GPU 上运行 70B 参数大模型推理,无需多卡或大规模显存配置。该项目已开源,相关讨论在 Hacker News 上获得 103 点热度,引发社区关注。
Cloudflare 发布 Billable Usage API,为自助账户提供单一端点,一次调用即可返回按产品和计费周期拆分的用量与成本,覆盖 Workers、R2、D1、Workers AI、Vectorize、Images 和 Stream。
欧盟《人工智能法案》下的新透明度义务于 8 月 2 日生效,要求公司披露用户何时与 AI 模型互动,并为合成音视频和文本添加机器可读标记。欧盟还推出了一套可选的 AI 披露标签供平台采用,但标注要求本身是强制性的。违规公司面临最高 1500 万欧元(约 1720 万美元)或全球年营业额 3% 的罚款,8 月 2 日前推出的模型有 4 个月宽限期。
Qwen 正式发布 Qwen3.8-Max,这是 Qwen 家族迄今最强的模型,拥有 2.4T 参数(95B 激活),并首次开源 Qwen-Max 级权重,开放权重将于下周发布。
Palantir CEO Alex Karp 在季度股东信中警告,前沿 AI 实验室对企业过于不可信,并称其意图"占有所谓合作伙伴的生产资料",带有"马克思主义色彩"。该公司第二季度营收 19 亿美元,同比增长 93%,利润 11 亿美元。Karp 主张 Palantir 提供模型无关的 AI 与分析软件,让企业掌控自身数据与 AI"废气"(提示词、编排、上下文)。
推出 Ori Eval:编写首个评估的最简单方式。 没有绝对最好的模型,只有最适合每项任务的模型。Ori Eval 利用 OpenRouter 的 API 处理代码库中的每项任务,然后评估结果。 curl -fsSL https://openrouter.ai/skills/spawn-ori-eval
MiniMax 正式开源新一代通用视频模型 H3,可统一理解文本、图像、视频和音频,生成最高 2K 分辨率、最长 15 秒、带 32 kHz 原生立体声音频的视频。
使用 Kimi Work 制作幻灯片 - 教程 #1。 Kimi Slides 处理整个幻灯片制作流程: - 清晰的结构与研究,由 Kimi K3 驱动 - 连贯的设计,包括精美的图表和 SmartArts - 可编辑并可直接下载 欢迎在评论区告诉我们你还想看什么内容!
除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。