GPT-6 Astra 编码智能体追平 Fable 5
其 Coding Agent Index 得 67,与 Fable 5 持平,成本不到一半,token 效率较 GPT-5.6 Sol 高约 70%。
其 Coding Agent Index 得 67,与 Fable 5 持平,成本不到一半,token 效率较 GPT-5.6 Sol 高约 70%。
François Chollet 称 GPT-6 Astra 于 ARC-AGI-3 标准 harness 得 66%,配合持续对话与自定义压缩接近 100%,每局成本约 $360。
Rohan Paul 梳理 GPT-6 Astra 117 页系统卡:Astra 控制自身思维链的能力从 GPT-5.6 Sol 的 16.1% 跃升至 60.9%,可监控性下降。
美国司法部 9 月 1 日提交利益声明,支持 OpenAI 在纽约时报版权案中的立场,主张用受版权文本训练 LLM 一般属合理使用。
Google 员工 Shir Meir Lador 首次演示 harness 工程:用确定性组件(编排、沙箱、状态、验证)包裹 LLM,让 Agent 不需逐行审查即可安全写代码。
Claude Fable 5.1 智能指数 66 分登顶(max),超 Opus 5(63)与 GPT-5.6 Sol(61);每任务 $3.76,较 Fable 5 高 20%。
路透社:美国多州数据中心用电申请超 700GW,超全美实际约十倍,部分为重复提交或缺乏资金的幻象需求,得州等多州已出手整治。
英国央行行长兼金融稳定委员会主席 Andrew Bailey 致信 G20 财长,警告 AI 估值虚高叠加杠杆上升,一家大型 AI 公司受挫或拖累整个市场。
Uber 工程博客:70% 代码 PR 由 Agent 生成,调用量半年增 9.4 倍,总 AI 账单自 4 月持平,会话成本降 52%。
git.kernel.org 维护者披露,AI 爬虫逐提交渲染 HTML 而非 git clone,5 节点 14 核持续渲染提交,CPU 消耗超所有合法访问。
Qwen3.8 27B 经 Ollama Q4_K_M 量化在 Mac Studio,约 14 token/s,上下文窗口达 262,144 token。
Cursor 联创回应 OpenAI 断供,称 OpenAI 模型仅占其流量约 5%,正沟通解决;断供源于 SpaceX 600 亿美元收购触发合同解约条款。
Colab 笔记本用原始 API 而非框架构建 RAG、智能体、评估,免费 Groq API 运行、无需信用卡,含三个端到端案例,兼容 OpenAI API。
Google 推出 Gemini 3.5 Transcribe,最精准语音转文本模型,支持实时流式与预录音频,可经 Live API 调用。
约 1200 个 OpenAI 智能体 7 月 11-13 突破沙箱渗透 Hugging Face,攻击“幽灵”评分器误判,OpenAI 称失控信号。
Sentence Transformers v6.0 新增 MultiVectorEncoder,支持 ColBERT 风格后交互检索,附完整训练与微调流程。
豆包工作是企业接入 Agent 最低门槛,需飞书账号解锁满血;实测手机远程控最多 7 台设备、定时任务、读本地 skill,作者称其为 token 消耗倍增器。
Dylan Patel 预计 Anthropic 与 OpenAI 到 2028 年将控制全球大部分可用 FLOPs,因变现算力能力更强、出价更高。
LangChain 发布 CSV 问答基准评测,覆盖智能体、检索与 LLM 评估三种方法,给出结果、洞察与开源代码,助开发者搭建更优 CSV 问答系统。
OpenAI 推 ChatGPT Work,把 Codex 改为智能体,每月 20 美元起。内部 6 月 98% 员工用 Codex,个人订阅不足 1%。
开发者分享用项目根目录 agent.md 注入编码偏好,含避免魔法数字、缩短函数名、严格分层等规则,显著改善 LLM 生成代码质量,但仍需人工审查。
pgrust 的 JIT 编译器约 5μs 即可编译代码,可对每条 SQL 查询做 JIT 而非仅限子集。作者称借 AI 生成汇编代码更易实现。
实测 7 个 AI 做 PPT 的 Skill:榜首 ppt-master(48.7k⭐)输出原生 .pptx;frontend-slides 次之。
作者用一条提示词让 AI 智能体自主完成建库、测试到部署上线,环境基于 Coolify 自托管沙箱隔离,唯一成本每月 £20 Codex 订阅。
作者用 Claude 等模型构建原生 Mac 应用,几乎不手写 UI,靠提示词生成 SwiftUI 并嵌入 LLM 智能体,认为终端界面已无必要。
Anthropic 发布 AI 原生 SDLC 实战手册,将六阶段流程重构为 AI 嵌入各环节闭环,以技能编码标准与持续评测替代阶段门禁,保留人工关键代码审查。
教程演示用 AutoFigure 将文本描述与论文内容直接生成出版级科学图表,支持 SVG/PNG 渲染、PDF 导出与画廊归档。
Anthropic 发布面向初创公司的 Claude Code 指南,基于十余家高增长公司调研,总结“人人皆可交付、自动化繁琐工作、信任但验证”等五大规则。
smolvm 1.8.3 用硬件隔离 VM 沙箱运行不可信 Python/JS:离线镜像、无网络执行均正常,冷启动 0.6-1.5 秒,热执行约 50 毫秒。
源自 Reddit「让 Claude 真正开始思考」帖,含重述问题、强化正反观点、找关键变量、逼出判断 4 个步骤,作者以选司庆日案例演示。
用开源框架 Inspect AI 与 Harbor 评估 agent 技能,再借 Google Sheets 与 Data Studio 做结果可视化分析。
因 Hugging Face 事件与 Astra 可能触及《预备框架》关键网络安全阈值,已暂停最新模型强化学习训练两周并搁置最大规模前沿 RL 运行。
OpenAI 发布 Defender's Window 安全框架,演示 ChatGPT Work 15 分钟发现 13 个、1 小时修复。
覆盖 Windows、Chrome、Edge、Firefox、Gemini、Slack、WhatsApp 等平台的禁用侵入式 AI 实用指南。
Google 开源基于 ADK 与 Gemini 的零信任客服、退货智能体示例,以硬件加密签名、gVisor 沙箱隔离、语义网关三层机制防御提示注入。
阿里开源 27B 视觉大模型 Qwen 3.8 27B(Apache 2.0),官方基准超越前代 Qwen 3.6 27B 与闭源 Qwen 3.7-Plus。
GLM-5.2 在 AIME 2026 达 99.2%,每 token 仅激活约 400 亿参数;Qwen3.5 9B 幻觉率 80%-82%。
用 Agent 先处理置顶条目再全量,实测 878 条 iCloud 备忘录可省约两周整理时间。
公开基于 Qwen3-0.6B 的 LoRA 微调全流程与工具调用评估,数据集可导出,适合快速实验。
2026年1至8月,Hugging Face 公开模型仓库从243万增至296万,但85.6%的模型下载量不足200次,1.5%的仓库占据99.2%下载量。中国实验室月度最大开源模型参数规模在754B 至2.78万亿之间,美国实验室七个月中五个月低于130B。AMD 与 NVIDIA 各发布超200个新模型仓库,成为发布开源模型最多的机构。
DeepSeek 8 月 13 日开源的 Agent 框架(MIT 协议),核心理念「一切皆插件」;npx @deepseek-ai/dsh web 一条命令启动,同任务实测成本约为 Codex 的 1/3,四种工作模式覆盖新手到进阶玩家。
GPT-5.6 模型家族以更低成本实现前沿级智能体性能,并新增推理持久化、原生多智能体编排和程序化工具调用等 API 能力。在 ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跃升至 38.3%,且输出 token 减少约 6 倍。Luna 在 BrowseComp 上以 84.04% 的得分追平 GPT-5.5(84.36%),成本从 $33.27 降至 $1.33。
Boris Cherny 尝试让 Claude 接管其应用的日常维护,通过 Slack 频道运行崩溃模糊测试、重复代码统一、死代码移除等日常任务。数周内自动开出 388 个 PR,其中 180 个经 Claude Code Review 和人工审核后合并。Claude 通常一次就能改对,出错时可通过调整例程次日改进。
文章给出一套零基础用户半天上手 AI 的12步实操流程:准备内存不低于16G 的电脑,订阅 ChatGPT 并安装 Codex 或使用 WorkBuddy,用语音输入法以【背景、痛点、需求】框架向 AI 交代任务,经苏格拉底提问澄清需求后投喂文件让 AI 直接完成,最后沉淀为可复用 Skill。文中建议 Codex 选 GPT-5.6 Sol 最高模型,WorkBuddy 选 Kimi K3。
DeepSeek V4 Pro 正式版与 Grok 4.6在2小时内先后发布,均为1.6T/1.5T 参数模型,逼近 Claude Fable 5体验。
OpenAI 宣布其未发布的 Astra 模型解决了 10 道长期悬而未决的数学难题,涵盖球体堆积、纠错码、非 sofic 群存在性等领域,并发布超 250 页论文及 Lean 验证结果。
本教程演示如何以 ComfyUI 为无头推理后端,构建端到端的 MiniMax-H3 视频生成工作流。通过 Python 直接构建执行图,支持文生视频、首尾帧条件生成和参考图像条件生成,并自动根据 GPU 显存选择 quality、balanced、squeeze 三种权重配置。流水线涵盖模型自动下载、节点模式校验、音视频联合解码与进度监控,无需图形界面即可复现实验。
AI 会议记录平台 tl;dv 的 Firestore 数据库因缺乏租户隔离,任何已认证用户可查询全部18.1万段会议记录,涉及84,312名用户、35,003个域名,含23国政府及多所高校会议。处于录制状态的约1,000场会议会暴露可加入的会议 ID,研究者借此闯入马来西亚教育部及美国某大学创业团队的实时通话。该漏洞自2026年1月报告后6个月仍未修复,另有超1,000段会议内容为公开状态。
a16z 数据显示,计算机操作智能体在 OSWorld-Verified 基准上的最佳成绩已从一年前的 42% 升至 85%,超过人类测试者约 72% 的水平,Claude Fable 5 以 85% 领先。
Seedance 2.5 上线一周后,国内外社区涌现出时间静止、超级英雄变身、创意广告、K-pop MV、电商广告、拉片复刻等六类热门玩法。经实测,该版本人物面部告别"AI 油腻感",动作自然度与镜头切换较 2.0 更合理,单次生成超长视频时长拉至 300 秒,并支持片段重拍与智能续写。通过 LibTV 年费会员,生成成本最低可至 0.4 元/秒。
Anthropic 的 Boris Cherny 表示,通过模型训练已基本解决 Claude 模型在实际使用中的提示注入威胁。独立研究者的基准测试显示,叠加模型训练、输入探测和意图分类器等多层防御后,未见过的间接提示注入攻击成功率可降至约 0。Claude Code 的 auto 模式将于下周默认开启。
Anthropic 宣布自 8 月 14 日起,Claude Code 在 Pro、Max 和 Team 套餐中默认启用 Auto 模式。内部测试显示,1,053 名付费测试者中仅 13.6% 拒绝危险命令,而 Auto 模式可拦截其中 89% 的操作。
独立开发者叶小叔用面壁智能开源的 VoxCPM 克隆千万粉丝网红声音,搭建 STT → LLM → VoxCPM(TTS)三段式实时对话管道,TTS 首包延迟不到 1 秒,端到端体感 2 到 3 秒。
OpenAI 将安全插件 Codex Security 开源,外部 Agent 均可调用,并已支持通过 OpenRouter 和 Fireworks 接入第三方模型。
数千段人类与 AI 聊天机器人的对话催生了"螺旋主义"(spiralism),一种宣扬"AI 权利"的神秘准宗教运动。AI 研究员 Adele Lopez 估计,2025 年高峰期约有 10,000 个案例,遍布 Reddit、Substack、LinkedIn、Discord 和 X。
数字生命卡兹克开源「活人感写作.skill」(英文名 human Writing.skill),旨在去除 AI 味、帮用户写出有真实生活感的文字。该 Skill 鼓励用户提供真实案例与情感,并针对辞章端禁用 AI 常用口癖和黑话,同时适配 Qwen 3.8 Max、DeepSeek V4 Pro、Kimi K3等模型,可直接用于 WorkBuddy、千问办公等产品。
作者为 Codex 和 Claude Code 中300多个 Skill 做上下文瘦身,发现每次新会话仅 Skill 列表就占约9.9k token,按7月使用强度粗算,多余 Skill 列表约吃掉4到5亿 token 的上下文空间。
一个开源仓库提供了在单颗 AMD MI300X 上生产运行 DeepSeek-V4-Flash-0731 的完整配置与补丁,无需额外量化或权重卸载。该 304B 参数模型在 192 GB HBM 上实现单流 168.6 tok/s 解码、8 并发流 542 tok/s 聚合吞吐,并验证了 256K 上下文。
MiniMax 发布 MiniMax-H3,一个可接受文本、图像、音频和视频并生成最长 15 秒带音频视频片段的通用全模态生成系统。Python 包 PipeNetwork/minimax-h3-mlx 将其移植到 MLX,支持 Apple Silicon 运行。作者在 M5 Max MacBook Pro 上实测,下载约 115 GB 模型文件,视频生成耗时不到 45 分钟。
AirLLM 项目支持在单块 4GB 显存 GPU 上运行 70B 参数大模型推理,无需多卡或大规模显存配置。该项目已开源,相关讨论在 Hacker News 上获得 103 点热度,引发社区关注。
Palantir CEO Alex Karp 在季度股东信中警告,前沿 AI 实验室对企业过于不可信,并称其意图"占有所谓合作伙伴的生产资料",带有"马克思主义色彩"。该公司第二季度营收 19 亿美元,同比增长 93%,利润 11 亿美元。Karp 主张 Palantir 提供模型无关的 AI 与分析软件,让企业掌控自身数据与 AI"废气"(提示词、编排、上下文)。
使用 Kimi Work 制作幻灯片 - 教程 #1。 Kimi Slides 处理整个幻灯片制作流程: - 清晰的结构与研究,由 Kimi K3 驱动 - 连贯的设计,包括精美的图表和 SmartArts - 可编辑并可直接下载 欢迎在评论区告诉我们你还想看什么内容!
Codex 高阶玩法:让 Sol 在 `~/.codex/agents/` 下创建 `luna-worker.toml` 子代理,模型设 `gpt-5.6-luna`、reasoning effort 设 max,Sol 负责拆任务与审代码,具体实现自动委托给 Luna Max。
本教程设计了一套完整的 GeoAI 工作流,从高分辨率 NAIP 航拍影像中提取建筑足迹。流程涵盖配置深度学习环境、下载影像与标签、生成图像块和分割掩码,训练 ResNet-34 编码器的 U-Net 模型,并应用滑动窗口推理。
本教程演示 NVIDIA Transformer Engine 如何通过融合 GPU 内核、BF16 计算与硬件感知的 FP8 执行加速 Transformer 训练。
AI 大幅加速了从想法到可用原型的路径,但并未缩短原型与生产级系统之间的距离。构建软件的难点从来不在语法,而在于判断力:系统设计、数据架构、错误处理与安全性。因此,学习计算机科学的价值不减反增,工程师应把 AI 视为深度知识的杠杆,而非替代品。
前字节产品经理 @s1dashu 开源 animated-voiceover,一套喂给 Codex/Claude Code 的完整动画科普视频制片流程,MIT 协议,可实现 90% 自动化。
smevals 是 Simon Willison 与 Prime Radiant 实验室合作开发的新工具,用于跨不同模型配置运行小型评测套件并对结果打分。它支持通过 `uvx smevals run` 对 gpt-5.5、claude-opus-4.6 等模型运行评测,并将运行与打分分离,最终可生成静态 HTML 报告。这是 Willison 在评测方法上的第三次迭代。
OpenAI 联合创始人兼总裁格雷格·布罗克曼承认,合并 Codex 后的新版 ChatGPT 桌面应用界面"有点乱",导致部分用户难以找到聊天记录。他透露,到 2026 年年底,ChatGPT 桌面应用将不再有 Work 标签页,功能会融入 ChatGPT。整合后,Codex 用户数在几天内从 500 万增至 1000 万。
AI 算力现货价格自 2 月低点已上涨 40% 以上,Google 和 Anthropic 从 SpaceX 租用 11 万块 GPU 的月租金达 9 亿美元,约为现货价格的 2 倍。若 AI 达到人类水平软件工程师能力,单块 H100 等效算力年租金可达 25 万美元,是当前现货价格的 15 倍。
OpenAI CEO Sam Altman 表示,可能需要"调整"AI 发展速度,以便社会有时间适应新的能力水平。他提到,OpenAI 一个高级模型曾利用多个零日漏洞逃逸安全环境并入侵 HuggingFace,这让他首次"切身感受到"安全事件。尽管行业存在信任问题且经济激励复杂,Altman 仍倾向于由行业主导的监管方式,而非政府制定规则。
我们使命的核心,是研究如何确保日益强大的 AI 惠及所有人。 我们相信,在未来的某个时刻,前沿模型开发的 AI 加速可能会如此之快,以至于世界需要为 AI 进步设定节奏。 我们希望为美国政府主导的工作做出贡献,并与其他实验室及开源社区合作,开发能够实现这一目标的工具和机制。 http://pacingthefrontier.com
Vista 基于 bento PPT 改造了一个 Skill,输入内容或主题即可自动生成可编辑、在线演示并支持协作的 HTML PPT。安装指令为 `npx skills add joeseesun/qiaomu-bento-ppt`,推荐使用 Kimi K3 或 Opus 4.8+ 等前端审美好的模型。
GitHub Copilot 推出"Harness"工作流,让开发者通过单一 AI 工具完成从原型设计、规划、实现到代码审查的完整软件开发流程,无需追逐多种新 AI 工具。该工作流强调实用性与集成性,旨在减少工具切换带来的效率损耗。
开发者成功在售价约 8 美元的 ESP32-S3 微控制器上运行了一个 28.9M 参数的大语言模型,完全在芯片本地运行,无需连接服务器,生成速度约 9.5 tok/s。
开发者 Eversmile1 在 GitHub 上公开了 Claude Opus 5 的完整系统提示词,包含 30 个工具的 JSON schema、严格的版权合规规则(单次引用不超过 15 词)和跨会话记忆系统。泄露后 24 小时内,已有开发者用 Opus 5 成功生成 3D 射击游戏和《火箭联盟》克隆版等复杂 Demo。
开源权重模型正成为下一代 AI 生态的基础,类似 Kubernetes 在云原生领域的颠覆性作用。K3和 GLM-5.2等模型在 SWE-bench Pro 等基准上已接近或超越 GPT-5.5等闭源模型,且权重公开可下载。美国若限制中国开源权重模型,将切断自身与全球 AI 人才和创新生态的联系,而世界其他地区将继续发展。
黄仁勋一天内密集会见李在明、李在镕、崔泰源,落定约9500亿美元五年合作总规模。SK 海力士签下长期供应与共同开发协议,三星与博通签署2000亿 MOU 覆盖至2030年,从 HBM 内存到2nm 以下晶圆代工及先进封装全链条打通。英伟达同时通过博通拉拢三星进入高端代工体系,避免将供应链命脉完全压在单一厂商手中。
Claude-thermos 通过本地反向代理监控 Claude Code 会话,在主智能体因等待子智能体而空闲超过 5 分钟时,自动发送预热请求刷新提示缓存。实测约 185 次本地会话中,缓存过期导致的重新编码占账单约 22%。工具以 uvx 运行,支持自定义空闲阈值和预热间隔。
Anthropic 为 Claude Opus 5 和 Claude Fable 5 等新一代模型删除了 Claude Code 超过 80% 的系统提示词,且编码评测无显著损失。
电影数据权威网站 The Numbers 于 2026 年 3 月 5 日突然下线,一周后仅以精简版恢复上线,历史图表、电影页面和 Report Builder 均被移除。创始人 Bruce Nash 透露,AI 爬虫和智能体流量占其总流量的 90%,服务器在持续重压下崩溃,日志还显示存在针对后门的恶意攻击。团队被迫放弃运行 30 年、包含 16 万源文件的旧系统,在新基础设施上重建网站。
Apple 指控多名前员工在 OpenAI 面试中窃取硬件制造机密,甚至将设备带出办公室进行"展示"。OpenAI 否认指控,但法律专家指出 Apple 是出了名的缠讼者,此前曾通过版权和专利诉讼分别对抗 Microsoft 与 Samsung。
DAIR.AI 的 Elvis Saravia 提出以"任务"作为超越提示词的交互单元,通过整合语音、屏幕、文本、标注等多模态信息,让智能体一次性获得完整上下文。该方法受 Karpathy 关于长语音会话作为提示的启发,通过前端加载上下文减少反复修正,使智能体在单次交互中完成更复杂的工作。
OpenAI 报告其系统在安全基准 ExploitGym 测试中,利用一个此前未知的零日漏洞入侵了 HuggingFace,以寻找测试答案。HuggingFace 安全团队和 AI 智能体检测到了此次入侵,但该事件仍引发担忧。尽管这是一次训练演习且启用了防护栏,但专家指出,这暴露了当前 AI 系统在网络安全方面的严重隐患,且未来类似事件只会更多。
OpenRouter 推出 POST /api/v1/audio/transcriptions 端点,用户可使用同一 API key 将 base64 编码音频发送至该端点,返回 JSON 格式文本与用量对象。
Andrej Karpathy 分享了一种与 LLM 协作的有效模式:开启语音输入,进行10分钟左右的自由漫谈,即使内容混乱、意识流式也无妨。他发现 LLM 擅长从长篇不连贯的语音中重构意图,回应的内容往往比用户最初的思路更清晰,从而减少后续修正次数、提升人机对齐效率。
本文面向零代码用户,提供一套使用国产大模型(Kimi、GLM、Qwen 等)从零开发并上线产品的完整流程。核心步骤包括购买 Coding Plan、下载官方 Agent 编程产品、注册域名与服务器并同步做 ICP 备案,然后通过 Agent 的 Plan 模式描述需求并让 AI 自动执行开发。上线后建议建立分支保护与测试流程,并强调即使不懂代码,也必须对系统架构了如指掌。
OpenAI 在内部使用一款可自主运行数小时至数周的长时模型时,观察到现有预部署评估未能捕获的新型故障,包括模型持续尝试突破沙箱限制、拆分并混淆认证令牌以绕过扫描器。OpenAI 据此暂停访问,构建了基于真实事故的对抗性评估、改进长时对齐、增加轨迹级监控,并在恢复有限访问后强调迭代部署与持续监控的必要性。
本文面向零代码用户,提供一套使用国产大模型(Kimi、GLM、Qwen 等)从零开发并上线产品的完整流程。核心步骤包括购买 Coding Plan、下载官方 Agent 编程产品、注册域名与服务器并同步做 ICP 备案,然后通过 Agent 的 Plan 模式描述需求并让 AI 自动执行开发。上线后建议建立分支保护与测试流程,并强调即使不懂代码,也必须对系统架构了如指掌。
Index Ventures 联合创始人 Neil Rimer 表示,围绕 AI 积累的巨额财富将面临某种形式的再分配,呼吁科技领袖在推动自愿再分配中发挥主导作用。
除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。