AirLLM 实现单块 4GB GPU 运行 70B 模型推理
AirLLM 项目支持在单块 4GB 显存 GPU 上运行 70B 参数大模型推理,无需多卡或大规模显存配置。该项目已开源,相关讨论在 Hacker News 上获得 103 点热度,引发社区关注。
8条精选
AirLLM 项目支持在单块 4GB 显存 GPU 上运行 70B 参数大模型推理,无需多卡或大规模显存配置。该项目已开源,相关讨论在 Hacker News 上获得 103 点热度,引发社区关注。
Cloudflare 发布 Billable Usage API,为自助账户提供单一端点,一次调用即可返回按产品和计费周期拆分的用量与成本,覆盖 Workers、R2、D1、Workers AI、Vectorize、Images 和 Stream。
欧盟《人工智能法案》下的新透明度义务于 8 月 2 日生效,要求公司披露用户何时与 AI 模型互动,并为合成音视频和文本添加机器可读标记。欧盟还推出了一套可选的 AI 披露标签供平台采用,但标注要求本身是强制性的。违规公司面临最高 1500 万欧元(约 1720 万美元)或全球年营业额 3% 的罚款,8 月 2 日前推出的模型有 4 个月宽限期。
Qwen 正式发布 Qwen3.8-Max,这是 Qwen 家族迄今最强的模型,拥有 2.4T 参数(95B 激活),并首次开源 Qwen-Max 级权重,开放权重将于下周发布。
Palantir CEO Alex Karp 在季度股东信中警告,前沿 AI 实验室对企业过于不可信,并称其意图"占有所谓合作伙伴的生产资料",带有"马克思主义色彩"。该公司第二季度营收 19 亿美元,同比增长 93%,利润 11 亿美元。Karp 主张 Palantir 提供模型无关的 AI 与分析软件,让企业掌控自身数据与 AI"废气"(提示词、编排、上下文)。
推出 Ori Eval:编写首个评估的最简单方式。 没有绝对最好的模型,只有最适合每项任务的模型。Ori Eval 利用 OpenRouter 的 API 处理代码库中的每项任务,然后评估结果。 curl -fsSL https://openrouter.ai/skills/spawn-ori-eval
除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。