2026-07-20 AI快讯

8条精选

微博 RSS
产品发布

字节跳动发布 Seed Audio 1.0 音频创作模型,统一建模人声与音效实现端到端影视级音频生成

字节跳动 Seed 团队发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声,支持 100ms 间隔精度的时间控制、单次约 2 分钟音频的延展生成及 20+ 语种自然生成。该模型已在火山方舟体验中心上线,多数场景音频可用率达 90% 以上,多语言音频自然度 MOS 超 4 分。

来源:字节 Seed:Research Feed(网页内嵌数据)阅读原文
行业动态

Hugging Face 遭自主 AI 智能体入侵,用 AI 工具完成数小时取证分析

Hugging Face 披露其部分生产基础设施遭一个自主 AI 智能体系统入侵,攻击者通过恶意数据集利用数据处理管道中的代码执行漏洞,窃取了内部数据集和多项服务凭证。该公司部署 LLM 驱动的分析智能体,在数小时内完成了对17000多条攻击行为的取证分析,而此类工作通常需要数天。

来源:The Decoder:AI News(RSS)阅读原文
模型发布

面壁智能发布首个具身智能成果 MiniCPM-Robot 系列模型,含 1.5B VLA 与 0.9B 跟踪模型

面壁智能联合 OpenBMB 发布并开源 MiniCPM-Robot 系列,包括通用 VLA 模型 MiniCPM-RobotManip(1.5B 参数)与移动跟踪模型 MiniCPM-RobotTrack(0.9B 参数)。

来源:公众号:面壁智能(MiniCPM)阅读原文
观点

不会代码也能做产品:一份从0开始的 Vibe Coding 保姆级教程

本文面向零代码用户,提供一套使用国产大模型(Kimi、GLM、Qwen 等)从零开发并上线产品的完整流程。核心步骤包括购买 Coding Plan、下载官方 Agent 编程产品、注册域名与服务器并同步做 ICP 备案,然后通过 Agent 的 Plan 模式描述需求并让 AI 自动执行开发。上线后建议建立分支保护与测试流程,并强调即使不懂代码,也必须对系统架构了如指掌。

来源:公众号:数字生命卡兹克阅读原文
产品发布

LoRA Speedrun 公开排行榜:6分05秒微调 Qwen2.5-1.5B 达 GSM8K 61.1%准确率

LoRA Speedrun 项目推出公开排行榜,在固定硬件(单张 L40S)上比拼 Qwen2.5-1.5B 的微调运行时间。当前纪录由@Saivineeth147以6分05秒保持,采用序列打包与仅完成损失掩码技术,相比基线11分57秒提速约2倍且准确率更高(61.1%)。项目提供免费 Modal 沙箱验证,任何提交需经3次独立复现确认。

来源:Hacker News 热门(buzzing.cc 中文翻译)阅读原文
行业动态

黄仁勋访日:Nvidia 联手日本打造物理 AI 时代,Noetra 主权 AI 工厂与 Cosmos 机器人联盟落地

Nvidia CEO 黄仁勋在 7 月 15-16 日访日期间,宣布为日本建设"Vera Rubin AI 工厂",配备 13,750 颗 Vera CPU 和 27,500 颗 Rubin GPU,预计 2028 年投运。

来源:TechCrunch:AI(RSS)阅读原文
模型发布

通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型

通义实验室发布 Qwen-Audio-3.0-TTS,含 Flash(首包延迟约300ms)和 Plus 两个版本。Plus 版本在 Artificial Analysis 榜单夺冠,支持16种语言和20种中文方言,平均 WER/CER 低至3.87(Flash),说话人相似度最高达82.75(Plus)。

来源:公众号:通义实验室(千问)阅读原文
产品发布

小红书与北大开源 UltraEP:面向大规模 MoE 训推的实时负载均衡方案

小红书与北大提出 UltraEP,首次将基于精确路由信息的实时负载均衡引入生产系统,在每个 microbatch 和每一层动态复制热点专家。在 Qwen3-235B 等模型上,训练吞吐平均达到理想性能的 94.6%,相比 Megatron-LM 提升 42%;推理 prefill 吞吐相比 SGLang 提升 1.56 倍。

来源:公众号:小红书技术(dots.llm)阅读原文
← 2026-07-19 2026-07-21 →全部快讯

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。

链接已复制,打开微信粘贴即可分享
0