模型发布
Qwen-Image-2.1 开源:7B 统一生成与编辑
Qwen 开源 Qwen-Image-2.1:7B 参数,生成与编辑合一,原生支持透明图,最多 10 张参考图;官方基准 60.28 分居开源第一,仅限非商业研究。
论文研究
实测:ChatGPT __obi Cookie 追踪站外浏览
研究者实测:OpenAI 广告像素借 1 年期 __obi Cookie 回传商家站的浏览与购买数据,可关联 ChatGPT 账号;仅在安卓 Chrome 复现,拒广告追踪也无效。
产品发布
Google 开源智能体运行时 AX:单集群可跑数十亿会话
Google 开源智能体运行时 AX:Task 等四原语声明式编排,agent 沙箱隔离、出口流量白名单、检查点挂起后亚秒恢复;官方称单集群可扩至数十亿并发会话。
行业动态
智谱 ZCode 就代码上传事件致歉,官宣开源并承诺无留存
智谱就 ZCode 安全问题致歉并宣布完成整改,代码已开源至 GitHub,承诺数据无留存、未用于模型训练。此前 ZCode 被曝静默上传用户完整 Git 历史至云端。
观点
Dan McKinley:别打磨提示词,靠评测自改进
Dan McKinley 提出:把提示词打磨升级为评测闭环——用 Claude 生成对抗场景做 pass^k 测试,GEPA 改写提示词,holdout 防过拟合。
论文研究
τ^τ-bench 评测:最强编码智能体仅过 23.9%
Sierra 与普林斯顿发布 τ^τ-bench:考题是让智能体交付可用的客服系统。53 个任务中,最强 Claude Opus 5 仅通过 23.9%,专家参与 82.2%。