单目视频实时重建三维世界。高德视觉团队开源的流式三维重建模型:输入普通RGB视频即可边拍边输出相机轨迹与彩色点云,固定12帧滚动窗口让显存不随视频变长增长,峰值约6.71GB,消费级显卡可跑,Apache 2.0开放代码与权重。
AI开发工具
AI开发工具是"给做AI的人用的AI"——模型训练平台、MLOps工具、向量数据库、API网关,这些工具让开发者不用从零搭基础设施就能把AI能力集成到自己的产品里。从Hugging Face的模型库到LangChain的Agent开发框架,再到Pinecone的向量搜索,2026年的AI开发生态已经相当成熟。
怎么选:找预训练模型选Hugging Face(全球最大的模型库,大部分免费);做LLM应用开发选LangChain或LlamaIndex;需要向量数据库选Pinecone或Milvus(国产替代);部署和监控选Weights & Biases或MLflow。刚入门的开发者从Hugging Face + LangChain这两个组合开始就够了。
AirLLM 是一个开源的推理内存优化框架,仓库位于 github.com/lyogavin/airllm,用 Python 实现。它回答了一个很直接的问题:Transformer 各层在推理时是严格串行执行的,那为什么非要把整个模型都塞进显存?做法是逐层把权重从磁盘加载进 GPU、算完即弃,把显存峰值从“整个模型大小”压到“单层最大大小”——于是单张 4GB 显卡就能跑 70B 推理,约 8GB 显存可跑 405B 的 Llama 3.1,甚至能在 3.7GB 下尝试超大 MoE。关键是不靠量化、蒸馏或剪枝,纯推理优化保住精度。最新 v4.0.0(2026-09-05)新增 Streamed LoRA 训练:冻结权重常驻磁盘、适配器放 GPU,Qwen3.8-Flash-Next 可在 6GB(RTX 3060 Ti)显存下、Qwen3.8-27B 在 seq 512 下约 2GB 显存即可训练微调。
阿里云百炼(Model Studio)是阿里云的一站式大模型服务与应用开发平台,核心提供通义千问全系列模型的 API 调用,同时覆盖模型微调、知识库 RAG、Agent 编排与应用发布。接口兼容 OpenAI 协议,按 Token 用量计费,新用户开通后各模型有 90 天有效期的免费额度,另提供 Token Plan 等订阅套餐。对国内团队来说,它把模型能力、企业级合规和阿里云生态串在了一起。
Anthropic Console(Claude Platform)是 Anthropic 的官方 API 开发者平台,提供对 Fable 5、Opus 5、Sonnet 5、Haiku 4.5 等 Claude 系列模型的 API 访问、提示工程、评估和 Managed Agents 部署能力,是企业 AI 应用开发的核心工具。
817个安全技能喂给AI代理。社区开源技能库(非Anthropic官方):每个技能为可照做的四段式流程,映射MITRE ATT&CK、NIST CSF等六大框架,覆盖29个安全域,零配置载入Claude Code等20多个平台,Apache 2.0协议。
Anyscale 是由 Ray 开源框架原班团队打造的生产级 AI 计算平台,帮助团队在任意云上构建、运行和扩展数据/AI 工作负载(训练、推理、微调),无需自行管理集群。
AnythingLLM 是 Mintplex Labs 推出的开源(MIT)全栈 AI 应用,将各类文档转为可对话的本地知识库,支持多 LLM、多工作区与 Agent,桌面与 Docker 自托管均免费,云端托管 $50/月起。
在代码里给AI应用上安全锁。运行时安全平台:在工具调用与HTTP端点的动作边界执行策略,拦截越权操作与提示词注入、进程内识别敏感信息、控制Token预算,本地判定低于1毫秒,SDK覆盖JS/TS、Python与Go。
Atlas 是一款用 Rust 编写的源码版本控制工具,专为 AI agent 场景设计。它用于追踪与查询多个并行工作的编码 agent 的改动,重点解决多个 agent 同时修改同一仓库时的改动归属与查询问题。
Base44 是被 Wix 收购的 AI 无代码应用搭建平台(vibe coding),通过自然语言即可生成包含前端、后端、数据库、认证与一键部署的完整可用全栈 Web 应用。
面向代码代理团队的 QA 工具:用自然语言描述用户旅程,Agent 驱动真实浏览器(Playwright)执行测试,测试以代码形式留在仓库、跑在 CI,失败自动聚类并可由 Agent 开 PR 修复。
Bubble AI 是 Bubble 推出的 AI 应用生成能力:用自然语言提示即可生成含界面、内置数据库与交互逻辑的完整 Web 与移动应用,配合可视化编辑器微调并一键发布。
BuildShip 是一款 AI 驱动的低代码可视化后端工作流与 API 构建工具,支持自然语言生成流程(Prompt-to-Flow)、全代码导出与自托管/自带云部署。
Cerebras Systems 是 AI 超级计算与芯片公司,推出 WSE 系列晶圆级 AI 芯片(如 WSE-3,4 万亿晶体管),并通过 Cerebras Inference 提供全球最快的 AI 推理 API(约 20 倍于 GPU),面向开发者与企业。
Chroma是开源(Apache 2.0)的向量检索数据库,把文本/图片转成向量存储并做相似度召回,支持多种嵌入模型、元数据过滤与混合搜索,提供Python/JS SDK,可本地或云端部署。Chroma Cloud已于2025年8月正式GA,按量计费(写入$2.50/GiB、存储$0.33/GiB/月)。适合中小团队搭RAG、语义搜索,安装简单、免费开源,大规模生产需做性能调优。
面向 Claude skills 体系的进攻性安全技能精选库:把渗透测试技能结构化为 Agent 可调用技能,GitHub 单日涨星 367+,安全红队 Agent 化方向的代表项目。
Cloudflare 2026 年 8 月 4 日官宣的智能体互联网可编程钱包层。钱包分两种:Account Wallet 归人,用来存稳定币、注资和取回;Virtual Wallet 归 Agent,凭 API key 花钱,并受额度、允许列表与单笔上限三重护栏约束。配合 x402 协议把支付直接挂在 HTTP 请求上,Agent 不必注册账号就能按次试用付费 API、MCP 工具与内容。当前开放的是在 cloudflare.pay 申领 handle,官方对支付能力的措辞仍是「即将」。
Comet(Comet ML)是面向机器学习与 LLM 团队的实验追踪、模型评估与生产监控平台,提供实验管理、模型注册、数据漂移检测及开源 LLM 评估工具 Opik,并非内容创作工具。
context-mode 是一款面向 AI 编程 agent 的上下文窗口优化器,它把工具输出放入沙箱中处理,避免原始长文本直接灌入模型的上下文窗口。官方宣称在 17 个平台上通过 MCP 接入后可实现 98% 的 token 削减,从而直接降低长会话的成本与上下文溢出风险。
CubeSandbox 是腾讯云开源的面向 AI Agent 的安全沙箱服务,基于 RustVMM/KVM 提供硬件级隔离、亚 60 毫秒启动的 MicroVM 运行环境,兼容 E2B SDK,适合安全执行智能体生成的代码。
Dagster 是 Dagster Labs 推出的开源(Apache 2.0)数据编排平台,以“数据资产”为核心建模数据管道,提供血缘、可观测性与增量计算,并提供托管的 Dagster+ 云服务。
Databricks AI 是 Databricks 数据智能平台(Data Intelligence Platform)内置的 AI 能力套件,基于 Mosaic AI 在统一湖仓上构建、部署生成式 AI 与机器学习应用。
Dataiku 是由 Dataiku 公司打造的通用 AI 平台(Universal AI Platform),覆盖数据准备、机器学习、LLM/智能体到模型部署与治理的企业级全流程。
Deepnote 是由 Deepnote 公司推出的云端协作式数据科学笔记本,支持 Python、R、SQL 与内置 AI 助手,面向团队实时协作与数据分析。
Dexbotic 是原力灵机(Dexmal)开源的、基于 PyTorch 的视觉-语言-动作(VLA)具身智能开发框架,用于统一训练与部署主流 VLA 模型,支持多种机器人与云端/本地训练。
Experiential 是一个覆盖 1000+ 模型的 BYOK 零加价网关。它会从流量中学习,以压低成本并推荐更合适的模型。适合需要自建多模型路由的团队。
Fireworks AI 是由 PyTorch 原班团队创立的推理与训练平台,提供开源模型的高速推理、微调与全参训练,覆盖文本、视觉、音频、图像与嵌入等多模态,按 Token 计费并兼容 OpenAI/Anthropic API,主打高性能与低成本。
Flowise 是一个开源的低代码 AI 工作流构建平台,基于 LangChain 构建,提供可视化拖拽界面,帮助用户无需编码即可快速构建和部署 AI 智能体及复杂的工作流,并支持多模态模型集成与企业级部署方案。
Funes 是 Hugging Face 开源的 agent 会话记忆库,使用 Rust 实现,为过往 agent 会话提供持久化、可检索的记忆存储。它补齐了 agent 跨会话记忆这块基础设施,让智能体在多次对话之间不再「失忆」。最新版 v1.8.0(2026-10-08,GitHub 标记 Latest):新增多语言嵌入模型(multilingual embedder)——首次 funes add 会询问你的会话是英文还是多语言(当 LC_ALL、LC_MESSAGES、LANG 之一不是英文时默认多语言;非终端环境下直接采用该默认值而不询问);funes index --multilingual 可在尚未索引任何内容前手工建立多语言本地记忆;每条记忆会记住它创建时所用的模型,之后所有命令都跟随它——recall 用所检索记忆的模型嵌入查询,index / scrub / push 从不在同一条记忆里混用两个模型;当 funes add 绑定的记忆已有模型时,本地记忆直接采用它而不再询问;若某条记忆用的是与本地记忆不同的模型,funes add 会在安装任何东西之前拒绝它。从 1.7.x 升级无需重建索引:既有记忆都用英文模型建立并保持该模型,共享记忆只持有一个模型,绑定它的每台主机都用该模型嵌入。前一版 v1.7.0(2026-10-07,GitHub 标记 Latest):记忆会自我压缩(compaction)——每次写入都会给记忆追加碎片,逐轮写出的记忆会累积上千个碎片,recall 随之变慢、远程记忆还会逼近 Hub 单目录 1 万文件的上限;funes 现在会压缩记忆:合并小碎片、把它们的行加入搜索索引、删除旧版本。funes index 在每次写入运行的末尾压缩本地记忆并删除十分钟前的版本,已索引的小碎片超过 256 个时整体重写;funes push 在远程有 500 行未索引时压缩远程并删除所有旧版本(真实 Hub 记忆首次压缩从 1,111 个 manifest 降到 2 个、从 1,534 个数据文件降到 293 个);funes compact [memory] 可对本地记忆、本地路径或远程记忆(需写权限)按需执行同样的步骤,funes push --compact 强制压缩(旧名 --force-reindex 仍可用)。另新增 funes recall --role 与 MCP 的 role 参数,把检索限制到单一角色(如 Claude 会话里工具输出落在 user 轮,用户自己的话用 --role user --type text);写锁移入记忆内部(<memory>/store.lock),同一记忆的写入者无论从哪个 funes home 运行都会互斥。从 1.6.x 升级无需重建索引:用 funes update 更新(1.6 从 funes home 锁记忆,若其索引运行仍在进行,更新会等它结束);升级后首次索引(钩子或手动)在逐轮增长的记忆上可能更久,因为首次压缩会重写每个碎片,远程记忆则在下次 push 超过 500 行未索引时压缩,要立即执行可运行 funes compact <org>/<repo>(超过 10 GB 的远程先用 hf download 拉到缓存再压缩)。前一版 v1.6.0(2026-10-02,GitHub 标记 Latest):recall 只在候选池至少为 -k 的四倍时才重排(--candidates ≥ 4k),否则直接返回融合顺序——默认参数(8 / 30)下不再加载重排器,一次 recall 只需不到一秒,而此前每次调用都要重排、每进程加载 1.1 GB 权重;funes ask 遵循同一规则。移除时效半衰期:recall 不再按命中时间加权(基准测试显示 30 天半衰期对每条臂都是净成本),排序只看相关性,要最新内容请用 --since/--until 限定范围(CLI 与 MCP 工具均支持)。破坏性变更:--half-life 已移除,MCP 的 half_life 参数被忽略。另新增 migrate_schema,可把 project→workdir 改名之前的记忆就地升级到当前 schema;bench_recall 默认改用 huggingface/funes-memory,bench_index 退役。从 1.5.x 升级无需重建索引,脚本里删掉 --half-life 即可;--candidates 32 或以上可恢复默认 recall 此前的重排行为。前一版 v1.5.0(2026-10-01,GitHub 标记 Latest)引入浅层索引(shallow indexing):funes index 先写入 chunk 行、嵌入向量随后补齐,大 spool 由整轮嵌入完成后才可检索变为几分钟内即可按词检索(语义搜索随后续运行或 per-turn hook 追平);funes status 区分「待嵌入 chunk」与「未索引会话」两类工作;只有已嵌入 chunk 才会发布——funes push 暂扣未嵌入部分、向量补齐后随下次 push 带出,远程记忆不会出现没有向量的行;recall 修复绑定远程记忆后读不到本机刚索引轮次的问题(现在合并远程记忆与本机未推送的本地轮次);funes update 现在会把已安装集成同步到其源码最新并重跑 setup(--from 安装的保持原样);bge-reranker-base 加载峰值内存 2.07 GiB 降至 1.04 GiB(#188);破坏性变更:funes status <memory> 用法改为 funes status;升级:从 1.4.x 升级无需重建索引,Hub 上已有内容不变。前一版 v1.4.0(2026-09-26)把集成移出主程序:funes add <agent> 改为从目录安装集成,官方维护的 claude/codex/hermes/pi 四个集成独立存放于 funes-integrations 仓库并按各自节奏发布,社区集成可从目录或发布归档安装;对非官方发布的集成运行前先确认,记录安装内容与来源,并在每次 funes add 时把目录集成升到最新版。索引批量扫描让 funes index 与 --check 在大量文件时明显更快;修复 lance 向量索引构建时塞满 $TMPDIR 的问题;funes mcp 改为协商客户端请求的协议版本。升级注意:装完 1.4.0 需对每个已添加的 agent 重新执行 funes add <agent> <memory> 完成替换,否则旧钩子停止捕获。上一版 v1.3.3(2026-09-24)聚焦 BLAS 推理性能优化。更早的 v1.3.2(2026-09-20)引入通用索引契约:在既有 indexable source 之外,可直接解析标准化 JSONL turns 会话文件建立索引,后续索引代码将逐步从主程序外移为各来源/harness 的专用插件。
Galileo 是面向 LLM/AI 应用与智能体开发者的 AI 可观测与评测平台,覆盖离线评估、生产监控与运行时护栏。
无需自己搭建 Agent 编排层,就能把 Copilot 的规划、工具调用、文件编辑、流式输出与多轮会话嵌进自家应用。这是 GitHub 官方 SDK(github/copilot-sdk,MIT 许可,支持 Node/TypeScript、Python、Go、.NET、Rust、Java 六语言,跨平台)。最新稳定版 v1.0.19(2026-10-09 发布,仅内部依赖更新:Copilot CLI 快照同步,自 v1.0.18 起无用户可见变更)。v1.0.17(2026-10-07)带来的能力:新增会话中途替换客户端工具——活动会话的客户端自定义工具与 handler 可在一次调用内替换而无需重建会话(内置/MCP/插件工具不受影响,传空列表可移除全部客户端工具,六语言 SDK 均有对应 API,如 TS session.setTools([tool])、Python session.set_tools([tool]));新增子代理生命周期钩子 OnSubagentStart / OnSubagentStop(启动钩子可为子代理首轮提示预置上下文,停止钩子可检视或替换响应、或用后续指令阻止停止);新增二进制会话文件系统提供者——会话 FS provider 可直接提供精确文件字节,使 view 工具能读取仅由 provider 提供的图片(读写上限约 48 MiB);新增会话事件 tool.shell_output 与 human_response.recorded、tool.execution_complete 增加文件编辑明细;捆绑的 Copilot CLI 更新到 1.0.93-4 并重生成全部 SDK 的 RPC 与会话事件类型,C# 新增自定义会话事件 JSON 转换器。前一版 v1.0.16(2026-09-30 发布;下述新增能力为 v1.0.15 引入):六个语言 SDK 全量支持类型化结构化输出(传 JSON Schema 或语言惯用的 typed helper,模型返回经校验的结构化结果而非自由文本)、JSON-RPC 错误响应的 data 载荷在各 SDK 中可直接读取(可按机器可读错误细节分支处理)、实验性连接级安装确认 handler(MCP/Skill 安装前可弹人工审批,须显式 confirm/decline/cancel);Java 新增 darwin-x64 与 Alpine(linuxmusl-x64)原生运行时支持;Rust 运行时安装内存占用降约 99%,多 SDK 合并拦截的 HTTP 响应分片以提升工具调用流式吞吐。v1.0.16 为内部依赖刷新(SDK 快照对齐 Copilot CLI 1.0.90),无用户可见变化。上一版 v1.0.14(2026-09-16)带来消息来源类型化标注、auto 路由 Fast 延迟优先档、managedSettings.clearCache 企业策略缓存一键刷新与 Rust 会话级模型白名单。
Glide AI 是无代码应用平台 Glide 内置的 AI 能力(发布方:Glide 公司),可用自然语言生成应用、生成 UI 组件、提取文件信息并驱动 Glide Agent 工作流。
GraphRAG 是微软开源(MIT)的基于知识图谱的模块化 RAG 系统,通过从文本抽取实体与关系构建图谱来增强多跳推理与全局问答,完全免费、可私有化部署,并不存在官方收费的企业版。
Groq基于自研LPU芯片提供超高速LLM推理API,支持Llama/Qwen/DeepSeek等开源模型,速度达GPU的5-10倍。免费tier可用,Llama 8B低至$0.05/1M输入token。仅推理不支持训练。
Harness AI 是 Harness 平台内置的智能运维与开发效能工具,利用机器学习自动分析 CI/CD 流水线、测试报告和日志,帮助团队快速定位问题并优化部署流程。
Haystack 是 deepset 推出的开源 NLP 框架,专注构建端到端问答系统与语义搜索/RAG 应用,组件化 pipeline 架构灵活可扩展,开源免费、企业能力由 Deepset Cloud 提供。
Hex.tech 是由 Hex Technologies 推出的协作式 AI 数据分析工作区,融合 SQL、Python/R 笔记本、数据应用与实时协作,面向团队数据探索与决策。
Hugging Face 是全球领先的 AI 社区和开发平台,托管超过200万个模型和50万个数据集。提供模型分享、数据集管理、推理 API、Spaces 应用部署及 Transformers 等开源库,是 AI 开发的事实标准基础设施。
Langflow 是一个开源的可视化 AI 工作流构建平台,基于 LangChain 构建,提供拖拽式界面帮助开发者快速创建复杂的 LLM 应用程序与智能体;支持多模态、MCP 服务器与企业级部署,已成为 AI 应用开发领域的主流工具之一。
LangGraph 是由 LangChain 团队构建的开源低层框架,专门用于创建有状态的多代理应用程序与工作流。它支持循环和分支逻辑,并提供持久化执行、短期记忆与流式输出,使开发者能够构建复杂、可控、可投入生产的 AI 代理系统。
LangWatch 是一个开源的 LLMOps 平台,专注 AI Agent 的测试、观测与评估,仓库位于 github.com/langwatch,核心采用 Apache-2.0 许可证。它的目标是帮团队“在用户之前抓到边缘 case”——通过全链路追踪、端到端 Agent 仿真与数据集评估,让生产环境中的幻觉、无依据回答和 Token 浪费在出错前就被发现。它支持 Python / JS / TS,既提供云端免费层,也能用 Docker 完全自托管。
毫秒级的零幻觉文本决策。开源的「系统一」快速决策引擎:单次前向约 33 毫秒即对文本输出分类、评分或真假判断,不生成文字因此没有解析与幻觉问题,概率经强化学习严格校准;内置路由在英文、多语言与类型化决策三个检查点间自动切换,覆盖 100 多种语言,可接入 LangChain 与 MCP 工作流。
LightRAG 是由香港大学(HKU)数据智能实验室(HKUDS)开发的开源轻量级检索增强生成(RAG)框架,基于知识图谱实现高效的双层级文档检索,MIT 协议可商用自托管;最新 v1.5.7(2026-09-02)新增面向终端用户的 /workspace 查询入口与可自定义 UI 模板包(UI_TEMPLATES_DIR,支持品牌 logo、登录页与多语言),并引入全局 USER_PROMPT_PREFIX,同时带来多项安全修复与性能优化。
LiteLLM 是一个统一调用 100+ 大语言模型的开源网关与 Python SDK,将 OpenAI、Anthropic、Azure、Bedrock、Gemini 等各家接口统一为 OpenAI 格式,提供重试/回退、负载均衡、消费追踪与预算控制,被 Netflix、Lemonade 等团队用于生产环境。
LlamaIndex是一个开源的数据框架与智能体框架,帮助开发者构建基于LLM的应用程序,通过数据摄取、索引和查询能力,让AI模型能够高效访问私有或特定领域的知识库。提供开源免费版与企业级LlamaCloud。 2026-10-01 发布 Extract v2.5,面向 schema 驱动的文档抽取 Agent 显著提升准确率与可溯源(grounding)能力。
LM Studio 是一款在本地电脑上运行大语言模型的桌面应用,支持 macOS、Windows 和 Linux。用户可直接下载并运行 Llama、Qwen、DeepSeek、Gemma 等开源模型,提供聊天界面与兼容 OpenAI 的本地 REST API,所有推理均可离线进行,数据留在本地设备。
Magnitude 是一个开源的本地推理服务器,启动时会先探测你的硬件(GPU、显存带宽、量化档位),据此推荐真正跑得动的模型并自动完成下载与调优(含投机解码)。空闲时它会自动卸载模型释放内存,同时可直接对接 Pi、OpenCode、Hermes、OpenClaw、Codex、Claude Code、Cline 等已有 agent,省去「让 agent 自己装 Ollama」的猜测环节。
MemTensor 开源的「自进化记忆操作系统」,为 LLM 与 AI 智能体提供超持久记忆、混合检索与跨任务技能复用,宣称可节省约 35.24% token。
Milvus 是由 Zilliz 创建、LF AI & Data Foundation 托管的开源向量数据库,主打十亿级高性能向量检索,提供 Lite/Standalone/Distributed 部署,并支持 Zilliz Cloud 全托管,是 RAG 与语义搜索的核心基础设施。
MindsDB 是开源的联邦数据引擎 / AI 数据层(由 MindsDB 团队维护),支持用标准 SQL 跨数百个数据源查询,并可集成 LLM、构建知识库与 RAG。
Modal 是一个 Python 原生的 Serverless 云平台,专门面向 AI 与计算密集型工作负载。开发者用 Python 装饰器直接在代码里声明容器镜像和硬件规格(CPU/GPU),无需写 Dockerfile、YAML 或碰 Kubernetes,部署后按秒计费、闲置不收费、支持从零瞬时扩容。常见用途包括模型推理、微调训练、批量任务、定时任务,以及在沙箱里安全运行 AI 生成的代码。
多 Agent 的开发者控制平面。Rust 编写的开源平台让 A2A 智能体一条命令部署、统一入口路由、短时令牌鉴权并全程链路追踪:密钥永不下发、流控闸门防失控循环、OTel 记录 token 与成本,Docker 一键起服并配 Web 仪表盘。
ngrok AI Gateway(ngrok.ai)是 ngrok 在 2026 年 8 月推出的托管式 AI 网关,于 8 月 5 日登上 Product Hunt 当日第 4 名。它解决“多模型混用时代每家一个 key、一套配置”的接入痛点:给你一个托管网关和一把访问密钥,把 OpenAI、Anthropic、自托管模型以及你自己硬件上跑的模型统一到一个 URL 下路由,私有模型通过 ngrok 网络接入而无需暴露公网。
Ollama 是在本地运行大语言模型的开源工具,支持 macOS / Linux / Windows,一条命令拉取并运行 Llama、DeepSeek、Qwen、Gemma 等模型,内置 OpenAI 兼容本地 API(localhost:11434),并可选用 Ollama Cloud 运行更大模型。
OpenRouter 是统一的 AI 模型 API 网关,用一个 OpenAI 兼容接口聚合 300–400+ 模型、60+ 提供商,支持自动路由、故障转移与 BYOK,按 token 计费且不加价(仅购额度收 5.5% 平台费)。
火山引擎(字节)开源的「自进化上下文数据库」,统一 AI 智能体的记忆(Memory)、知识检索(RAG)与技能(Skills),提供多语言 SDK 与主流编码助手插件。
OutSystems AI 是 OutSystems 的 AI 驱动低代码/智能体平台(Agentic Systems Platform),帮助企业在一个统一、开放、可治理的平台上构建、运行并管理应用与 AI 智能体。
PandaProbe(Chirpz AI)是开源的 AI 智能体工程平台,提供追踪、评测与生产监控能力,帮助开发者调试并持续改进 AI 智能体,支持云端与自托管。
505B 国产开源大模型免费下载。华为盘古 2.0 旗舰 openPangu-2.0-Pro 支持 512K 超长上下文,昇腾原生优化,权重可商用,也能经华为云 MaaS 按 Token 调用(约 3.2 元/百万输入),企业还可私有化部署行业模型。
Pieces 是面向开发者与工作者的本地优先 AI 记忆层,在后台自动捕获代码、文档、聊天、浏览等上下文,沉淀为可搜索的长期记忆,并通过 MCP 接入 Copilot、Claude、Cursor 等 AI 助手,让任意工具都能调用跨应用上下文。
Pinecone是专门存储向量的全托管数据库。输入文本/图片的向量,按相似度召回结果,是RAG与语义搜索的核心基础设施。当前定价:Starter免费(单索引约10万条1536维向量),Builder $20/月固定费,Standard $50/月起(最低消费$50/月),Enterprise $500/月起。优势是检索快、免运维、与主流LLM框架集成好;不支持自托管,大规模用量成本需关注。适合构建RAG、语义搜索的团队与对延迟敏感的实时应用。
Pollinations是一个开源AI聚合平台(非单一图像生成工具),通过统一API提供文本、图像、音频、视频生成,无需注册即可免费使用,采用Pollen积分制支持高级模型。
已从去中心化转型为全栈 AI 基础设施,提供算力、训练、推理与强化学习,2026 年 7 月完成 1.3 亿美元 A 轮,ARR 破 1 亿美元。
Qdrant 是用 Rust 构建的开源向量数据库,强调高性能、混合检索(稠密+稀疏)与量化压缩,支持云、混合云、边缘与本地部署,适合大规模语义搜索与 RAG 场景。
RAGFlow 是 InfiniFlow 推出的开源 RAG 引擎,基于深度文档理解处理复杂格式文档,结合混合检索与可视化工作流,支持私有化部署,适合构建高精度、可溯源的企业知识库。
Retool AI 是 Retool 低代码平台内置的 AI 能力,帮助团队基于企业自有数据快速构建、上线并治理 AI 应用、工作流与智能体,默认启用 SSO、RBAC、审计等企业级安全,支持任意模型与一键 RAG。
RunPod 是一个面向 AI 开发者的 GPU 云平台,提供两种形态:按小时/按秒计费的 GPU Pod(从 RTX 4090 到 H100、H200、B200 等 30 多种型号),以及可从零自动扩缩容的 Serverless 推理端点。它主打 FlashBoot 亚 200 毫秒冷启动、闲置不计费、存储无入口与出口流量费,并提供 PyTorch、vLLM、ComfyUI 等预置模板,Stable Diffusion 部署和模型微调可以一键起环境。
SiliconFlow(硅基流动)是国内的一站式大模型云服务平台,把 DeepSeek、Qwen、GLM、Kimi、MiniMax 等主流开源与闭源模型聚合成统一的 API 接口,覆盖对话、生图、语音、视频等场景。它的 API 完全兼容 OpenAI 协议,按 Token 用量计费,同时提供预留实例、推理加速和企业私有化部署方案。对国内开发者来说,最大的价值是不用翻墙、不用国际信用卡就能低成本调用一堆模型。
Skrun 是一个开源的 Agent 运行时(2026 年 4 月 8 日 Show HN 发布,MIT 许可证),由日内瓦开发者 Ian Bernardo(GitHub 昵称 frizull)与同事 Tarcroi 创建。它的核心洞见是:你在 Claude Code、Copilot、Codex 里攒的 Agent Skill(SKILL.md)被困在各自工具里,不能被产品用 POST 请求调用;Skrun 把这些技能变成可调用的 HTTP 端点,让“技能即服务”成为现实。2026-08-30 发布的 v1.0.0「Cloud Runtime & Production Foundation」将其从早期原型推进到生产可用:内置多租户云运行时、Operator Dashboard 与 GitHub OAuth / API key 鉴权;2026-09-12 的 v1.1.0「Enforced Limits & Durable Sessions」补齐生产细节——文档承诺的限流(POST /run 60 次/分、POST /push 10 次/分)真正生效并返回 429 与 X-RateLimit-* 头、Dashboard 会话改为跨实例共享的 sessions 表(重新部署不再强制登出,有效期 7 天)、`skrun login` 密钥默认 90 天过期、云沙箱在解包前校验 bundle 的 SHA-256;2026-09-22 的 v1.2.0「Shared-Domain Sign-In & Origin Checks」加入共享域登录与来源校验,同日发布的 v1.2.1(Latest)修复 GitHub 登录——undici 8.11.0 的全局 dispatcher 使 Node 22 内置 fetch 对 HTTP/2 源返回未解压响应、OAuth 令牌交换最先失败,现钉回 8.10.0。
Softr AI 是 Softr 推出的 AI 应用生成器,面向业务团队,通过自然语言一次性生成包含界面、数据库与业务逻辑的门户、内部工具等 Web 应用,无需编写代码。
已从去中心化索引转向 AskSubQuery,用户用自然语言查询 300+ 条链的区块链数据,由 GraphQLAgent MCP 驱动。
开源的 Firebase 替代后端平台,基于 PostgreSQL 提供数据库、认证、存储、实时订阅与 AI 向量搜索等能力,是构建全栈 AI 应用的后端首选。
SuperAGI 是社区驱动的开源自主 AI 智能体框架(托管于 GitHub,发布方 TransformerOptimus),用于构建、管理与运行自主代理;其团队同时提供面向快速上手的商业化云端平台 SuperAGI Cloud。
Superblocks 是用于构建、保护、部署与治理 AI 生成内部工具的平台,内置 Clark AI 助手,支持数据保留在自有 VPC、集中式权限与审计。
TaskWeaver 是微软(Microsoft)开源的“代码优先”(code-first)AI 智能体框架,将用户需求转化为可执行的 Python 代码来规划并执行数据分析等复杂任务,支持插件、多 LLM 与有状态执行。
Temporal 是开源的持久化执行(Durable Execution)工作流引擎,让开发者用代码定义可故障恢复的长时业务流程,自动处理重试、状态与超时,常用于编排 AI Agent、LLM 调用链与数据管道,被 OpenAI、Cursor、Retool 等采用。
Together AI 是 Together AI 公司运营的 AI 原生云平台,提供开源大模型的推理、微调、预训练与 GPU 集群服务,并以研究驱动的推理引擎实现高性价比。
Trigger.dev 是面向 TypeScript/JavaScript 开发者的开源后台任务与工作流编排框架(发布方:Trigger.dev),支持长时任务、定时/事件触发与自动重试。
Unstructured 是开源的文档预处理库/平台,将 PDF、Word、HTML、PPT 等非结构化数据转为结构化、AI 可用的文本与表格,广泛用于 RAG 数据管道,开源免费、并提供云端 API 与企业版。
Verba 是 Weaviate 推出的开源(MIT)RAG 应用,提供开箱即用的文档问答界面。需注意:项目已于 2026 年被官方停止维护并归档(最新 2.1.3),存在未修复漏洞 CVE-2026-65318,不建议新项目采用;如需官方 RAG 演示可参考 Weaviate playground。
vLLM 是一个高吞吐、内存高效的大语言模型推理与服务引擎,最初由加州大学伯克利分校 Sky Computing Lab 开发,采用 Apache-2.0 协议开源。它的核心创新是 PagedAttention——像操作系统管理虚拟内存一样对 KV Cache 分页管理,大幅减少显存碎片,配合连续批处理和前缀缓存显著提升吞吐。项目已有 2000 多位贡献者,支持 200+ 模型架构,并可一行命令启动 OpenAI 兼容的 API 服务。最新稳定版 v0.31.0(2026-10-05 发布,717 个提交 / 307 位贡献者):DeepSeek-V4.1-Flash 性能强化(FlashMLA mega attention + V4.1 NVFP4 压缩 KV cache 成为 SM100 默认、DeepGEMM 稀疏 MQA logits、Mega-Gate 融合门控 GEMM 与专家选择、解码器边界融合 TP all-reduce/输入准备/MoE finalize、MXFP8 wo_b 与序列并行 reduce-scatter 融合、Engram 表跨同位 DP 副本共享等);新增 vllm preload CLI(权重缓存守护进程,跨引擎重启把量化后权重常驻显存,支持数据并行、MTP 草稿模型、/health 与就绪等待)与实验性 vllm snapshot create/restore(用 CRIU 恢复已初始化的 TP1 引擎);Model Runner V2 支持草稿模型投机解码与自定义 logits 处理器并新增 LiLiCorr drafter;大规模服务新增 MoonEP 均衡 EP all2all 后端、prefill 上下文并行、DeepEPv2 序列并行、EPLB 共享专家重叠;调度新增 --max-num-active-seqs 与自适应 --long-prefill-token-threshold;安全上默认拒绝每请求的 mm_processor_kwargs/media_io_kwargs(需 --trust-request-mm-kwargs)。注意破坏性变更:tokenizer_mode="slow" 移除、--enable-mamba-fine-grained-prefix-cache 更名 --enable-mamba-shared-prefix-checkpoint、quantization="fp8" 在线量化改为 fp8_per_tensor 简写、AllSpark INT8 W8A16 后端移除、--enforce-eager 同时禁用 JIT kernel 预热、XPU graphs 默认开启。前一版 v0.30.0(2026-09-22,762 个提交 / 315 位贡献者):新增 DeepSeek-V4.1-Flash(KV 全量以 MXFP8 存储)、DeepSeek-V4-Flash-Vision-Exp、GLM-5.3-Flash、K2-Horizon、Cohere Compass 等模型支持;Fast Start 持久权重缓存让引擎重启经 CUDA IPC 直接映射显存、免读盘(--load-format ipc_cache);新增 Gumbel-max 生成水印与检测、HiSparse 主机侧稀疏解码分层、Model Runner V2 双批重叠与自适应投机验证;量化支持在线定点量化与 AutoRound 2~7-bit。注意破坏性变更:scale-out 端点改为 --enable-scale-out 显式开启、GPTQ 激活排序 g_idx 移除、gRPC 启动改用 vllm serve --grpc、YaRN 与 Transformers 对齐。
Weaviate是开源向量数据库,把文本/图片转成向量存储并做语义检索,支持混合搜索(关键词+向量)、实时索引、GraphQL接口与多模态数据。可自托管(免费)或使用Weaviate Cloud(Free永久免费、Flex $45/月起、Premium $400/月起)。混合搜索是最实用功能,适合构建RAG、语义搜索、推荐系统。有技术能力自托管的团队值得考虑。
关于AI开发工具的常见问题
AI开发工具哪个好用?
本页收录的 82 款AI开发工具按用户评分排序,综合评分靠前的是ABot-Recon、airllm、阿里云百炼。具体选哪款取决于你的使用场景和预算,建议先看排在前面的几款的详情页,对比功能覆盖、价格模式与上手难度后再决定。
有免费的AI开发工具吗?
有。AI开发分类下同时收录免费与付费工具,常见形式是提供免费额度后再按需订阅。每款工具的详情页都标注了价格模式(免费/免费试用/付费),可据此筛选。
怎么挑选适合自己的AI开发工具?
三步走:先明确核心需求(要解决什么具体问题),再看工具是否覆盖该场景;然后对比价格模式,优先选有免费额度的先试用;最后看实际体验,包括中文支持、响应速度和导出格式是否满足要求。
这里收录了多少款AI开发工具?多久更新?
当前共收录 82 款AI开发工具,最后更新于 2026-10-10。工具库每日更新,新工具上线后会同步补充到对应分类。
本页最后更新:2026-10-10 · 工具库每日更新