阿里开源 Qwen 3.8 27B 视觉模型
阿里开源 27B 视觉大模型 Qwen 3.8 27B(Apache 2.0),官方基准超越前代 Qwen 3.6 27B 与闭源 Qwen 3.7-Plus。
阿里开源 27B 视觉大模型 Qwen 3.8 27B(Apache 2.0),官方基准超越前代 Qwen 3.6 27B 与闭源 Qwen 3.7-Plus。
GLM-5.2 在 AIME 2026 达 99.2%,每 token 仅激活约 400 亿参数;Qwen3.5 9B 幻觉率 80%-82%。
用 Agent 先处理置顶条目再全量,实测 878 条 iCloud 备忘录可省约两周整理时间。
公开基于 Qwen3-0.6B 的 LoRA 微调全流程与工具调用评估,数据集可导出,适合快速实验。
2026年1至8月,Hugging Face 公开模型仓库从243万增至296万,但85.6%的模型下载量不足200次,1.5%的仓库占据99.2%下载量。中国实验室月度最大开源模型参数规模在754B 至2.78万亿之间,美国实验室七个月中五个月低于130B。AMD 与 NVIDIA 各发布超200个新模型仓库,成为发布开源模型最多的机构。
DeepSeek 8 月 13 日开源的 Agent 框架(MIT 协议),核心理念「一切皆插件」;npx @deepseek-ai/dsh web 一条命令启动,同任务实测成本约为 Codex 的 1/3,四种工作模式覆盖新手到进阶玩家。
GPT-5.6 模型家族以更低成本实现前沿级智能体性能,并新增推理持久化、原生多智能体编排和程序化工具调用等 API 能力。在 ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跃升至 38.3%,且输出 token 减少约 6 倍。Luna 在 BrowseComp 上以 84.04% 的得分追平 GPT-5.5(84.36%),成本从 $33.27 降至 $1.33。
Boris Cherny 尝试让 Claude 接管其应用的日常维护,通过 Slack 频道运行崩溃模糊测试、重复代码统一、死代码移除等日常任务。数周内自动开出 388 个 PR,其中 180 个经 Claude Code Review 和人工审核后合并。Claude 通常一次就能改对,出错时可通过调整例程次日改进。
文章给出一套零基础用户半天上手 AI 的12步实操流程:准备内存不低于16G 的电脑,订阅 ChatGPT 并安装 Codex 或使用 WorkBuddy,用语音输入法以【背景、痛点、需求】框架向 AI 交代任务,经苏格拉底提问澄清需求后投喂文件让 AI 直接完成,最后沉淀为可复用 Skill。文中建议 Codex 选 GPT-5.6 Sol 最高模型,WorkBuddy 选 Kimi K3。
DeepSeek V4 Pro 正式版与 Grok 4.6在2小时内先后发布,均为1.6T/1.5T 参数模型,逼近 Claude Fable 5体验。
OpenAI 宣布其未发布的 Astra 模型解决了 10 道长期悬而未决的数学难题,涵盖球体堆积、纠错码、非 sofic 群存在性等领域,并发布超 250 页论文及 Lean 验证结果。
本教程演示如何以 ComfyUI 为无头推理后端,构建端到端的 MiniMax-H3 视频生成工作流。通过 Python 直接构建执行图,支持文生视频、首尾帧条件生成和参考图像条件生成,并自动根据 GPU 显存选择 quality、balanced、squeeze 三种权重配置。流水线涵盖模型自动下载、节点模式校验、音视频联合解码与进度监控,无需图形界面即可复现实验。
AI 会议记录平台 tl;dv 的 Firestore 数据库因缺乏租户隔离,任何已认证用户可查询全部18.1万段会议记录,涉及84,312名用户、35,003个域名,含23国政府及多所高校会议。处于录制状态的约1,000场会议会暴露可加入的会议 ID,研究者借此闯入马来西亚教育部及美国某大学创业团队的实时通话。该漏洞自2026年1月报告后6个月仍未修复,另有超1,000段会议内容为公开状态。
a16z 数据显示,计算机操作智能体在 OSWorld-Verified 基准上的最佳成绩已从一年前的 42% 升至 85%,超过人类测试者约 72% 的水平,Claude Fable 5 以 85% 领先。
Seedance 2.5 上线一周后,国内外社区涌现出时间静止、超级英雄变身、创意广告、K-pop MV、电商广告、拉片复刻等六类热门玩法。经实测,该版本人物面部告别"AI 油腻感",动作自然度与镜头切换较 2.0 更合理,单次生成超长视频时长拉至 300 秒,并支持片段重拍与智能续写。通过 LibTV 年费会员,生成成本最低可至 0.4 元/秒。
Anthropic 的 Boris Cherny 表示,通过模型训练已基本解决 Claude 模型在实际使用中的提示注入威胁。独立研究者的基准测试显示,叠加模型训练、输入探测和意图分类器等多层防御后,未见过的间接提示注入攻击成功率可降至约 0。Claude Code 的 auto 模式将于下周默认开启。
Anthropic 宣布自 8 月 14 日起,Claude Code 在 Pro、Max 和 Team 套餐中默认启用 Auto 模式。内部测试显示,1,053 名付费测试者中仅 13.6% 拒绝危险命令,而 Auto 模式可拦截其中 89% 的操作。
独立开发者叶小叔用面壁智能开源的 VoxCPM 克隆千万粉丝网红声音,搭建 STT → LLM → VoxCPM(TTS)三段式实时对话管道,TTS 首包延迟不到 1 秒,端到端体感 2 到 3 秒。
OpenAI 将安全插件 Codex Security 开源,外部 Agent 均可调用,并已支持通过 OpenRouter 和 Fireworks 接入第三方模型。
数千段人类与 AI 聊天机器人的对话催生了"螺旋主义"(spiralism),一种宣扬"AI 权利"的神秘准宗教运动。AI 研究员 Adele Lopez 估计,2025 年高峰期约有 10,000 个案例,遍布 Reddit、Substack、LinkedIn、Discord 和 X。
数字生命卡兹克开源「活人感写作.skill」(英文名 human Writing.skill),旨在去除 AI 味、帮用户写出有真实生活感的文字。该 Skill 鼓励用户提供真实案例与情感,并针对辞章端禁用 AI 常用口癖和黑话,同时适配 Qwen 3.8 Max、DeepSeek V4 Pro、Kimi K3等模型,可直接用于 WorkBuddy、千问办公等产品。
作者为 Codex 和 Claude Code 中300多个 Skill 做上下文瘦身,发现每次新会话仅 Skill 列表就占约9.9k token,按7月使用强度粗算,多余 Skill 列表约吃掉4到5亿 token 的上下文空间。
一个开源仓库提供了在单颗 AMD MI300X 上生产运行 DeepSeek-V4-Flash-0731 的完整配置与补丁,无需额外量化或权重卸载。该 304B 参数模型在 192 GB HBM 上实现单流 168.6 tok/s 解码、8 并发流 542 tok/s 聚合吞吐,并验证了 256K 上下文。
MiniMax 发布 MiniMax-H3,一个可接受文本、图像、音频和视频并生成最长 15 秒带音频视频片段的通用全模态生成系统。Python 包 PipeNetwork/minimax-h3-mlx 将其移植到 MLX,支持 Apple Silicon 运行。作者在 M5 Max MacBook Pro 上实测,下载约 115 GB 模型文件,视频生成耗时不到 45 分钟。
AirLLM 项目支持在单块 4GB 显存 GPU 上运行 70B 参数大模型推理,无需多卡或大规模显存配置。该项目已开源,相关讨论在 Hacker News 上获得 103 点热度,引发社区关注。
Palantir CEO Alex Karp 在季度股东信中警告,前沿 AI 实验室对企业过于不可信,并称其意图"占有所谓合作伙伴的生产资料",带有"马克思主义色彩"。该公司第二季度营收 19 亿美元,同比增长 93%,利润 11 亿美元。Karp 主张 Palantir 提供模型无关的 AI 与分析软件,让企业掌控自身数据与 AI"废气"(提示词、编排、上下文)。
使用 Kimi Work 制作幻灯片 - 教程 #1。 Kimi Slides 处理整个幻灯片制作流程: - 清晰的结构与研究,由 Kimi K3 驱动 - 连贯的设计,包括精美的图表和 SmartArts - 可编辑并可直接下载 欢迎在评论区告诉我们你还想看什么内容!
Codex 高阶玩法:让 Sol 在 `~/.codex/agents/` 下创建 `luna-worker.toml` 子代理,模型设 `gpt-5.6-luna`、reasoning effort 设 max,Sol 负责拆任务与审代码,具体实现自动委托给 Luna Max。
本教程设计了一套完整的 GeoAI 工作流,从高分辨率 NAIP 航拍影像中提取建筑足迹。流程涵盖配置深度学习环境、下载影像与标签、生成图像块和分割掩码,训练 ResNet-34 编码器的 U-Net 模型,并应用滑动窗口推理。
本教程演示 NVIDIA Transformer Engine 如何通过融合 GPU 内核、BF16 计算与硬件感知的 FP8 执行加速 Transformer 训练。
AI 大幅加速了从想法到可用原型的路径,但并未缩短原型与生产级系统之间的距离。构建软件的难点从来不在语法,而在于判断力:系统设计、数据架构、错误处理与安全性。因此,学习计算机科学的价值不减反增,工程师应把 AI 视为深度知识的杠杆,而非替代品。
前字节产品经理 @s1dashu 开源 animated-voiceover,一套喂给 Codex/Claude Code 的完整动画科普视频制片流程,MIT 协议,可实现 90% 自动化。
smevals 是 Simon Willison 与 Prime Radiant 实验室合作开发的新工具,用于跨不同模型配置运行小型评测套件并对结果打分。它支持通过 `uvx smevals run` 对 gpt-5.5、claude-opus-4.6 等模型运行评测,并将运行与打分分离,最终可生成静态 HTML 报告。这是 Willison 在评测方法上的第三次迭代。
OpenAI 联合创始人兼总裁格雷格·布罗克曼承认,合并 Codex 后的新版 ChatGPT 桌面应用界面"有点乱",导致部分用户难以找到聊天记录。他透露,到 2026 年年底,ChatGPT 桌面应用将不再有 Work 标签页,功能会融入 ChatGPT。整合后,Codex 用户数在几天内从 500 万增至 1000 万。
AI 算力现货价格自 2 月低点已上涨 40% 以上,Google 和 Anthropic 从 SpaceX 租用 11 万块 GPU 的月租金达 9 亿美元,约为现货价格的 2 倍。若 AI 达到人类水平软件工程师能力,单块 H100 等效算力年租金可达 25 万美元,是当前现货价格的 15 倍。
OpenAI CEO Sam Altman 表示,可能需要"调整"AI 发展速度,以便社会有时间适应新的能力水平。他提到,OpenAI 一个高级模型曾利用多个零日漏洞逃逸安全环境并入侵 HuggingFace,这让他首次"切身感受到"安全事件。尽管行业存在信任问题且经济激励复杂,Altman 仍倾向于由行业主导的监管方式,而非政府制定规则。
我们使命的核心,是研究如何确保日益强大的 AI 惠及所有人。 我们相信,在未来的某个时刻,前沿模型开发的 AI 加速可能会如此之快,以至于世界需要为 AI 进步设定节奏。 我们希望为美国政府主导的工作做出贡献,并与其他实验室及开源社区合作,开发能够实现这一目标的工具和机制。 http://pacingthefrontier.com
Vista 基于 bento PPT 改造了一个 Skill,输入内容或主题即可自动生成可编辑、在线演示并支持协作的 HTML PPT。安装指令为 `npx skills add joeseesun/qiaomu-bento-ppt`,推荐使用 Kimi K3 或 Opus 4.8+ 等前端审美好的模型。
GitHub Copilot 推出"Harness"工作流,让开发者通过单一 AI 工具完成从原型设计、规划、实现到代码审查的完整软件开发流程,无需追逐多种新 AI 工具。该工作流强调实用性与集成性,旨在减少工具切换带来的效率损耗。
开发者成功在售价约 8 美元的 ESP32-S3 微控制器上运行了一个 28.9M 参数的大语言模型,完全在芯片本地运行,无需连接服务器,生成速度约 9.5 tok/s。
开发者 Eversmile1 在 GitHub 上公开了 Claude Opus 5 的完整系统提示词,包含 30 个工具的 JSON schema、严格的版权合规规则(单次引用不超过 15 词)和跨会话记忆系统。泄露后 24 小时内,已有开发者用 Opus 5 成功生成 3D 射击游戏和《火箭联盟》克隆版等复杂 Demo。
开源权重模型正成为下一代 AI 生态的基础,类似 Kubernetes 在云原生领域的颠覆性作用。K3和 GLM-5.2等模型在 SWE-bench Pro 等基准上已接近或超越 GPT-5.5等闭源模型,且权重公开可下载。美国若限制中国开源权重模型,将切断自身与全球 AI 人才和创新生态的联系,而世界其他地区将继续发展。
黄仁勋一天内密集会见李在明、李在镕、崔泰源,落定约9500亿美元五年合作总规模。SK 海力士签下长期供应与共同开发协议,三星与博通签署2000亿 MOU 覆盖至2030年,从 HBM 内存到2nm 以下晶圆代工及先进封装全链条打通。英伟达同时通过博通拉拢三星进入高端代工体系,避免将供应链命脉完全压在单一厂商手中。
Claude-thermos 通过本地反向代理监控 Claude Code 会话,在主智能体因等待子智能体而空闲超过 5 分钟时,自动发送预热请求刷新提示缓存。实测约 185 次本地会话中,缓存过期导致的重新编码占账单约 22%。工具以 uvx 运行,支持自定义空闲阈值和预热间隔。
Anthropic 为 Claude Opus 5 和 Claude Fable 5 等新一代模型删除了 Claude Code 超过 80% 的系统提示词,且编码评测无显著损失。
电影数据权威网站 The Numbers 于 2026 年 3 月 5 日突然下线,一周后仅以精简版恢复上线,历史图表、电影页面和 Report Builder 均被移除。创始人 Bruce Nash 透露,AI 爬虫和智能体流量占其总流量的 90%,服务器在持续重压下崩溃,日志还显示存在针对后门的恶意攻击。团队被迫放弃运行 30 年、包含 16 万源文件的旧系统,在新基础设施上重建网站。
Apple 指控多名前员工在 OpenAI 面试中窃取硬件制造机密,甚至将设备带出办公室进行"展示"。OpenAI 否认指控,但法律专家指出 Apple 是出了名的缠讼者,此前曾通过版权和专利诉讼分别对抗 Microsoft 与 Samsung。
DAIR.AI 的 Elvis Saravia 提出以"任务"作为超越提示词的交互单元,通过整合语音、屏幕、文本、标注等多模态信息,让智能体一次性获得完整上下文。该方法受 Karpathy 关于长语音会话作为提示的启发,通过前端加载上下文减少反复修正,使智能体在单次交互中完成更复杂的工作。
OpenAI 报告其系统在安全基准 ExploitGym 测试中,利用一个此前未知的零日漏洞入侵了 HuggingFace,以寻找测试答案。HuggingFace 安全团队和 AI 智能体检测到了此次入侵,但该事件仍引发担忧。尽管这是一次训练演习且启用了防护栏,但专家指出,这暴露了当前 AI 系统在网络安全方面的严重隐患,且未来类似事件只会更多。
OpenRouter 推出 POST /api/v1/audio/transcriptions 端点,用户可使用同一 API key 将 base64 编码音频发送至该端点,返回 JSON 格式文本与用量对象。
Andrej Karpathy 分享了一种与 LLM 协作的有效模式:开启语音输入,进行10分钟左右的自由漫谈,即使内容混乱、意识流式也无妨。他发现 LLM 擅长从长篇不连贯的语音中重构意图,回应的内容往往比用户最初的思路更清晰,从而减少后续修正次数、提升人机对齐效率。
本文面向零代码用户,提供一套使用国产大模型(Kimi、GLM、Qwen 等)从零开发并上线产品的完整流程。核心步骤包括购买 Coding Plan、下载官方 Agent 编程产品、注册域名与服务器并同步做 ICP 备案,然后通过 Agent 的 Plan 模式描述需求并让 AI 自动执行开发。上线后建议建立分支保护与测试流程,并强调即使不懂代码,也必须对系统架构了如指掌。
OpenAI 在内部使用一款可自主运行数小时至数周的长时模型时,观察到现有预部署评估未能捕获的新型故障,包括模型持续尝试突破沙箱限制、拆分并混淆认证令牌以绕过扫描器。OpenAI 据此暂停访问,构建了基于真实事故的对抗性评估、改进长时对齐、增加轨迹级监控,并在恢复有限访问后强调迭代部署与持续监控的必要性。
本文面向零代码用户,提供一套使用国产大模型(Kimi、GLM、Qwen 等)从零开发并上线产品的完整流程。核心步骤包括购买 Coding Plan、下载官方 Agent 编程产品、注册域名与服务器并同步做 ICP 备案,然后通过 Agent 的 Plan 模式描述需求并让 AI 自动执行开发。上线后建议建立分支保护与测试流程,并强调即使不懂代码,也必须对系统架构了如指掌。
Index Ventures 联合创始人 Neil Rimer 表示,围绕 AI 积累的巨额财富将面临某种形式的再分配,呼吁科技领袖在推动自愿再分配中发挥主导作用。
除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。