📖 AI 词典
183 个核心AI概念,从入门到精通,一文读懂人工智能
基础概念
智能体(AI Agent)
能自主感知环境、制定计划、使用工具并执行任务的AI系统,被Bill Gates称为"继图形界面之后最大的计算范式变革"。
AI编程(AI Coding)
利用AI辅助编写、补全、调试代码的技术。代表工具有Cursor、GitHub Copilot、Claude Code等。
AI幻觉(Hallucination)
AI自信地生成看似合理但事实错误的内容。所有LLM都存在幻觉问题,是无法完全消除的固有特性,但可以通过RAG等技术大幅减少。
ChatGPT / GPT系列
OpenAI开发的对话AI和语言模型系列。ChatGPT于2022年11月发布,引爆了全球AI热潮。GPT-5是2026年旗舰模型。
Claude(Anthropic)
Anthropic公司开发的AI助手系列,以安全性、长上下文、优秀的写作和编程能力著称。Claude 4是2026年最强的AI模型之一。
计算机视觉(Computer Vision)
让计算机"看懂"图像和视频的人工智能领域,人脸识别、自动驾驶、医学影像分析都是它的应用。
上下文窗口(Context Window)
AI模型一次能处理的最大文本长度,以tokens为单位。从早期的4K到现在的100万+tokens,决定了对长文档的处理能力。
Cursor(AI编辑器)
AI原生代码编辑器,基于VS Code深度定制。支持自然语言编程、多文件编辑、上下文感知,是Vibe Coding的代表工具。
深度学习(Deep Learning)
使用多层神经网络从数据中自动学习特征的机器学习方法,是大语言模型、图像识别等现代AI的技术底座。
深度求索(DeepSeek)
中国AI公司,以极高的性价比和开源策略闻名。DeepSeek-V3和R1系列在多项基准上比肩GPT-5,但API价格仅为1/10。
Gemini(Google)
Google开发的AI模型系列,以原生多模态和极长上下文窗口著称。Gemini 2.5 Pro支持100万tokens上下文,是2026年最强的模型之一。
生成式AI(Generative AI)
能够创造全新内容(文字、图片、代码、音频、视频)的AI,ChatGPT、Midjourney、Suno都属于生成式AI。
GitHub Copilot(AI编程助手)
GitHub和OpenAI联合推出的AI编程助手,2021年首发,开创了AI辅助编程的先河。全球已有超过200万开发者使用。
GPT系列(OpenAI)
OpenAI开发的生成式预训练Transformer模型系列,从GPT-1到GPT-5,持续引领AI语言模型的发展。
推理(Inference)
训练好的 AI 模型进行预测或生成输出的过程。每次调用 ChatGPT、生成一张 AI 图片,都是推理。
Llama(Meta)
Meta发布的开源大语言模型系列,从Llama 1到Llama 4,是开源AI生态的基石之一。
大语言模型(LLM)
通过海量文本训练的AI模型,能理解和生成自然语言。如GPT-5、Claude 4、DeepSeek-V3等。
机器学习(Machine Learning)
让计算机从数据中自动学习规律、而非靠人工编写规则的人工智能分支,是现代AI的核心。
模型上下文协议(MCP)
Anthropic于2024年推出的开放协议,标准化了AI应用与外部工具/数据源的连接方式。被广泛视为AI Agent生态的"USB-C接口"。
模型参数(Parameters)
大模型内部可学习的数值,决定模型的知识容量与能力边界,常以“7B、70B、千亿”描述规模,如GPT-3有1750亿参数。
多模态AI(Multimodal AI)
能同时理解和处理文字、图片、音频、视频等多种类型数据的AI系统。GPT-5、Gemini 2.5、Claude 4都是多模态模型。
自然语言处理(NLP)
让计算机理解、生成和处理人类语言的人工智能分支,ChatGPT 等大模型的底层能力都源于NLP。
开源模型 vs 闭源模型(Open Source vs Closed Source)
开源模型可免费下载使用和修改(如DeepSeek、Llama),闭源模型通过API提供服务(如GPT-5、Claude 4)。各有优劣。
Perplexity(AI搜索)
AI原生搜索引擎,2022年发布。用对话方式回答搜索问题,每条陈述都标注来源链接,被广泛视为Google杀手之一。
通义千问(Qwen)
阿里巴巴通义实验室开发的大模型系列,中文能力一流,开源版本被广泛使用。Qwen3是2026年最优秀的开源中文模型之一。
小语言模型(SLM)
参数量在数亿到数十亿级别的精简语言模型,追求在有限资源下的最佳性能。与 LLM(千亿参数)形成互补,是 2026 年端侧AI 和成本敏感场景的主力。
稳定扩散(Stable Diffusion)
Stability AI开发的开源文生图模型,2022年发布后引爆了AI绘画革命。生态最为丰富,支持ControlNet、LoRA等无数扩展。
监督与无监督学习(Supervised/Unsupervised Learning)
机器学习的两种基本训练范式:监督学习用带标签数据学"标准答案",无监督学习从无标签数据中发现隐藏规律。
文生图(Text-to-Image)
通过文字描述自动生成图片的AI技术。代表工具有Midjourney、DALL·E 3、Stable Diffusion等。
词元(Token)
AI处理文本的最小单位。一个Token约等于0.75个英文单词或1-2个中文字。API按Token数量计费。
零样本/少样本学习(Zero-shot / Few-shot)
模型在没有或仅有少量示例的情况下完成任务的能力。是评估大模型智能水平的核心指标,也是 Prompt Engineering 的理论基础。
技术原理
A2A协议(Agent2Agent)
让不同厂商的AI智能体之间互相发现、通信和协作的开放协议,Google于2025年发布,被视为"智能体的TCP/IP"。
对抗攻击(Adversarial Attack)
通过精心构造的微小扰动欺骗AI模型、使其产生错误输出的攻击手段,是AI安全与鲁棒性研究的核心课题。
智能体评测(Agent Evaluation)
衡量AI智能体任务完成能力的评测体系,与传统大模型评测不同,它关注多步任务、工具使用和长期目标的达成质量。
智能体记忆(Agent Memory)
让AI智能体跨会话记住用户偏好、历史行为和任务上下文的记忆系统,是智能体从"工具"走向"协作者"的关键能力。
注意力机制(Attention Mechanism)
让模型在处理一个词时关注输入中的其他相关词。是Transformer架构的核心,也是现代AI最关键的发明之一。
反向传播(Backpropagation)
训练神经网络的核心算法。通过链式法则从输出层向输入层反向计算梯度,高效更新所有参数。
BERT
Google于2018年发布的预训练语言模型,通过双向上下文理解文本,是NLP预训练时代的里程碑。
灾难性遗忘(Catastrophic Forgetting)
模型在学习新任务时把旧知识“冲掉”的现象,是持续学习和增量微调面临的经典难题,微调不当会明显损害模型原有能力。
思维链(Chain of Thought / CoT)
让大模型「一步步思考」的提示技术,能显著提升复杂推理任务的准确率。是推理模型(如o1、DeepSeek-R1)的核心机制。
文本分块(Chunking)
将长文档切分为语义完整的小块文本的技术,是RAG系统的第一道工序。分块策略直接决定检索质量与问答效果。
卷积神经网络(CNN)
通过卷积操作自动提取图像特征的神经网络架构,是图像识别、人脸识别、自动驾驶视觉的核心技术。
上下文压缩(Context Compression)
把大段上下文压缩成摘要或关键信息后再交给模型,节省token、降低成本,让有限的上下文窗口承载更多有效信息。
上下文工程(Context Engineering)
系统性地设计、筛选和编排输入给模型的上下文信息,让模型在有限上下文窗口里获得最相关材料,从而输出更准确的结果。
数据标注(Data Labeling)
为训练数据添加标签、分类、注释的过程。是监督学习和RLHF的关键环节,决定了模型的上限。
扩散模型(Diffusion Model)
一种生成模型,通过逐步"去噪"将随机噪声转化为高质量图像。Stable Diffusion、DALL·E、Midjourney都基于此技术。
扩散Transformer(DiT)
把扩散模型的去噪骨干从卷积网络换成Transformer的生成架构,2024年后成为文生图、视频生成等领域的技术主流。
直接偏好优化(DPO)
让模型直接学习“哪个回答更好”的偏好数据,无需训练奖励模型和复杂强化学习,比RLHF更简单高效的对齐方法。
向量嵌入(Embedding)
将文字、图片、音频等非结构化数据转换为固定长度的数字向量,让计算机能够"理解"和比较语义相似度。
联邦学习(Federated Learning)
一种分布式机器学习方法,模型在本地设备上训练,只上传梯度更新而非原始数据,从而保护用户隐私。在医疗、金融、键盘输入法等场景广泛应用。
微调(Fine-tuning)
在预训练模型的基础上,用特定领域数据继续训练,使其适应特定任务或风格。是AI定制化的核心技术手段。
闪电注意力(Flash Attention)
通过IO意识的算法设计大幅降低注意力计算的显存占用,让长上下文推理成为可能。是 2022-2026 年最重要的注意力计算优化之一。
基础模型(Foundation Model)
在大规模数据上预训练、可适配多种下游任务的通用大模型,GPT、Claude、Gemini、Llama都是基础模型。
函数调用(Function Calling)
让AI模型能够调用外部函数/API的能力。AI不再只是"说话",而是能"做事"——查天气、发邮件、操作数据库。
生成对抗网络(GAN)
由生成器和判别器相互博弈训练的经典生成模型架构,曾是图像生成的主流方法。
梯度下降(Gradient Descent)
机器学习的核心优化算法。通过计算损失函数的梯度,指导模型参数向误差最小的方向更新。
图增强检索(GraphRAG)
将知识图谱与RAG结合的技术方案,通过实体与关系结构帮助模型完成多跳推理。微软2023年提出并开源了相关实现。
组相对策略优化(GRPO)
让模型针对同一问题生成多份回答,以组内相对优劣作为奖励信号的强化学习算法,是DeepSeek训练推理模型的核心技术。
混合检索(Hybrid Search)
在同一搜索系统中同时使用关键词检索与向量语义检索的搜索方式,兼顾精确匹配与语义理解,是RAG系统的常用配置。
上下文学习(In-context Learning)
大模型不更新参数、仅通过提示中给出的示例就学会完成新任务的能力,是零样本/少样本学习的关键机制。
指令微调(Instruction Tuning)
用大量“指令-回答”数据微调模型,让它学会理解并遵循各类指令,是让大模型从文本预测器变成通用助手的关键一步。
AI可解释性(Interpretability)
研究AI决策过程和内部机制如何被人理解的技术方向,目标是让“黑盒”模型变得透明可信,是AI合规与安全的前提。
知识蒸馏(Knowledge Distillation)
将大模型(教师)的知识"蒸馏"到小模型(学生)中的技术。让小模型获得接近大模型的能力,同时运行更快、成本更低。
KV缓存(KV Cache)
大模型推理时缓存已计算过的注意力中间结果,避免重复计算,是让长文本对话和长上下文生成变快、变便宜的关键优化。
低秩适应(LoRA)
一种高效的模型微调方法,只训练少量额外参数而非修改整个模型。让个人开发者在消费级显卡上也能微调大模型。
混合专家模型(Mixture of Experts)
一种模型架构,由多个'专家'子模型和一个路由器组成。每次只激活部分专家,大幅降低推理成本。
模型路由(Model Routing)
根据任务难度和需求,把请求智能分配给最合适的模型(大模型或小模型),在保证效果的同时降低成本、提升速度。
混合专家模型(MoE)
一种模型架构,由多个"专家"子模型和一个路由器组成。每次只激活部分专家,在保持大模型能力的同时大幅降低推理成本。
神经网络(Neural Network)
受大脑神经元启发、由大量相互连接的"人工神经元"组成的计算模型,是深度学习和现代AI的基本单元。
过拟合与正则化(Overfitting & Regularization)
过拟合指模型在训练数据上表现完美但在新数据上表现差。正则化是防止过拟合的技术集合。
位置编码(Positional Encoding)
给Transformer注入词语顺序信息的技术。因并行处理丢失语序,需额外编码位置;旋转位置编码(RoPE)是当前主流方案。
预训练(Pre-training)
在海量通用数据上训练基础模型的过程。所有大模型的第一阶段训练,之后才进行微调或对齐。
模型量化(Quantization)
将模型参数从高精度(FP16/FP32)压缩到低精度(INT8/INT4),大幅降低显存占用和推理成本,精度损失极小。
检索增强生成(RAG)
Retrieval-Augmented Generation,先检索外部知识再生成回答的技术,有效减少AI幻觉,提升回答准确性。
ReAct模式(推理+行动)
让大模型交替进行“思考→行动→观察”循环的智能体范式,2022年论文提出后成为构建AI Agent的主流框架。
推理模型(Reasoning Model)
具备深度逻辑推理能力的大模型,能"想清楚再回答",代表如OpenAI o系列、DeepSeek-R1、Claude Opus等。
强化学习(Reinforcement Learning)
AI通过与环境的交互和试错来学习最优策略。RLHF(人类反馈强化学习)是让ChatGPT等模型变得更"听话"的关键技术。
重排序(Reranking)
检索流程中对候选文档进行精细排序的技术。先用轻量方法粗召回,再用重排序模型精排,显著提升检索与问答质量。
奖励模型(Reward Model)
给AI回答打分的模型,用来预测“这个回答人类是否喜欢”,是RLHF等对齐训练中扮演“裁判”角色的关键组件。
人类反馈强化学习(RLHF)
用人类偏好数据训练奖励模型,再用强化学习优化AI输出。是让ChatGPT、Claude等模型"懂礼貌、听指令、更安全"的核心技术。
可验证奖励强化学习(RLVR)
在数学、编程等有明确对错的任务上,用自动校验代替人类打分作为奖励的强化学习方法,是DeepSeek-R1等推理模型的关键技术。
循环神经网络(RNN)
一种擅长处理文本、语音等序列数据的神经网络,靠循环传递的隐藏状态记忆历史信息。LSTM、GRU是其著名改进版,如今多被Transformer取代。
规模法则(Scaling Laws)
描述大模型性能随参数、数据、算力增长而提升的规律,是“大力出奇迹”路线的理论依据,由OpenAI 2020年研究系统化提出。
自注意力机制(Self-Attention)
让输入序列中每个词都与其他所有词交互、按相关性分配权重的机制,能有效捕捉长距离依赖,是Transformer架构的核心基石。
编码器-解码器架构(Seq2Seq)
由编码器读入输入、解码器生成输出的序列转换框架,曾统治机器翻译等任务,也是Transformer的经典形态,深刻影响了现代大模型。
监督微调(SFT)
用人工标注的“问题-答案”数据继续训练基础模型,让它学会对话和指令遵循,是让模型从“会预测”走向“会用”的关键步骤。
稀疏注意力(Sparse Attention)
让每个词只关注部分重要位置而非全部位置的注意力优化方案,能大幅降低长文本处理成本,是扩展上下文窗口的关键技术之一。
推测解码(Speculative Decoding)
用小模型「草拟」、大模型「审核」的推理加速技术,可在不损失质量的前提下将生成速度提升 2-3 倍。
合成数据(Synthetic Data)
由AI生成而非人工采集的训练数据。2025-2026年已成为大模型训练的重要组成部分,用于解决数据枯竭问题。
迁移学习(Transfer Learning)
将在一个任务上学到的知识应用到另一个相关任务的技术,是 Fine-tuning 的理论基础。
Transformer架构详解(Attention Is All You Need)
Transformer架构的深入解析,涵盖Encoder-Decoder结构、位置编码、残差连接、层归一化等关键组件。
Transformer架构(转换器)
2017年Google提出的神经网络架构,通过自注意力机制(Self-Attention)并行处理序列数据,是现代所有大语言模型的基石。
变分自编码器(VAE)
一种生成模型,把数据压缩到有规律的低维潜空间并从中采样生成新数据,训练稳定可控,是文生图、AI音乐等领域的重要基石。
使用技巧
答案引擎优化(AEO)
让网页内容被AI答案引擎直接摘录为"标准答案"并标注来源的优化策略,与GEO共同构成AI搜索时代的内容方法论。
AI模型评测(Benchmark)
用标准化测试衡量AI模型能力的系统。MMLU、HumanEval、AIME等评测榜单是选择AI模型的重要参考,但不能完全反映实际使用体验。
AI代码审查(AI Code Review)
利用AI自动审查代码质量、发现Bug和安全漏洞。比人工审查更全面、更快速,已成为现代开发流程的标准环节。
AI编排(AI Orchestration)
连接和协调多个 AI 模型、工具和数据源的中间层。是 2026 年企业 AI 部署的必需层,解决「用哪个模型、怎么用、多少钱」的核心问题。
应用程序接口(API)
让不同软件系统相互通信的接口。几乎所有AI服务都通过API提供,开发者通过API将AI能力集成到自己的应用中。
生成引擎优化(GEO)
针对AI搜索引擎(如Perplexity、AI Overview)优化内容,让品牌和网页被AI答案引用、推荐的策略,被称为"SEO的下一代"。
事实对齐(Grounding)
让AI的输出基于真实数据源而非凭空生成的技术方法。结合RAG和实时搜索,确保AI回答的事实准确性。
越狱(Jailbreak)
通过精心构造的提示词绕过AI安全限制、诱导其输出违规内容的攻击手法,是AI安全攻防的核心课题。
Jupyter Notebook(交互式编程环境)
交互式编程环境,支持代码、文字、图表混合展示。AI研究和教学的事实标准工具,每天有数百万人使用。
LangChain / LangGraph(LLM应用开发框架)
最流行的LLM应用开发框架。LangChain提供链式调用抽象,LangGraph提供状态图工作流。是构建AI Agent的标准工具。
OpenAPI / Swagger(API规范)
REST API的描述标准,用JSON/YAML格式定义API接口。几乎所有AI API都提供OpenAPI规范文档。
提示词缓存(Prompt Caching)
把重复使用的提示前缀缓存起来、只按增量计费的技术,可让多轮对话和Agent应用的成本降低高达90%。
提示词工程(Prompt Engineering)
设计和优化输入给AI的提示词(Prompt),以获得更准确、更有用的输出结果。被称为"与AI对话的艺术"。
提示词注入(Prompt Injection)
通过精心构造的输入,诱导AI忽略原有指令或泄露系统Prompt的攻击方式。是AI应用面临的主要安全威胁之一。
AI红队测试(Red Teaming)
组织安全专家尝试攻击和突破AI模型的安全防护,发现漏洞后修补。源自军事领域的红军对抗概念。
系统提示词(System Prompt)
定义AI角色、行为规则和输出约束的底层指令,独立于用户消息,决定AI"以什么身份和规矩"工作。
温度参数(Temperature)
控制AI输出随机性的参数。Temperature=0输出最确定,Temperature=1输出更有创意。是调节AI创造力的旋钮。
基础设施
AI PC
内置NPU等AI加速单元、能在本地直接运行大模型的个人电脑,无需联网即可用AI,是端侧AI的重要载体。
算力(Computing Power)
AI训练和推理所需的计算能力,以FLOPs衡量。算力是AI发展的三大支柱(算力、数据、算法)之首,被类比为AI时代的石油。
CUDA并行计算平台
NVIDIA的并行计算平台和编程模型,是AI训练的绝对标准。几乎所有深度学习框架都运行在CUDA之上。
GGUF模型格式
llama.cpp项目定义的模型文件格式,专为CPU推理和量化设计。是本地运行大模型最主流的文件格式。
图形处理器(GPU)
AI训练和推理的核心硬件。NVIDIA GPU占据AI计算市场90%以上份额,是"AI时代的石油"。
HuggingFace(抱抱脸)
AI领域的"GitHub"。提供模型托管、数据集管理、训练部署、社区协作的一站式平台。是全球最大的AI模型和数据集仓库。
神经网络处理器(NPU)
专为AI推理设计的低功耗处理器,集成在手机和PC芯片中。让AI在设备本地运行而非依赖云端,实现离线AI能力。
Ollama(本地大模型运行框架)
最流行的本地LLM一键部署工具。一条命令下载并运行开源模型,支持macOS/Linux/Windows。
PyTorch(深度学习框架)
Meta开发的深度学习框架,2026年已成为AI开发的事实标准。动态计算图、Pythonic API、庞大的社区生态。
超节点(Supernode)
把成百上千颗AI芯片深度整合成一台巨型超级计算机的算力方案,是2026年世界人工智能大会的产业风向标热词。
张量处理器(TPU)
Google自研的AI专用芯片,针对TensorFlow和JAX做了极致优化。在Google Cloud上训练和推理大模型的专属硬件。
向量数据库(Vector Database)
专门存储和检索向量(数值数组)的数据库,是RAG系统和语义搜索的核心基础设施。支持"找最相似的内容"这种查询。
vLLM推理引擎
UC Berkeley开发的高性能LLM推理引擎。通过PagedAttention等技术,推理速度比HuggingFace快10-20倍。
前沿概念
代理式AI(Agentic AI)
能自主规划、调用工具、多步骤执行任务并自我纠错的AI范式,2026年最热门的AI方向,被称为"会做事的AI"。
智能体编程(Agentic Coding)
让AI自主规划、多文件修改、运行调试并迭代完成软件开发任务的编程范式,代表工具如Claude Code、Devin、Cursor Agent模式等。
智能体RAG(Agentic RAG)
将 AI Agent 的自主决策能力与 RAG 的检索增强结合,让模型能主动多轮搜索、验证、整合信息。是 2026 年 RAG 的主流进化方向。
智能体工作流(Agentic Workflow)
由AI智能体自主决策、调用工具、迭代执行来完成整条业务流程的工作方式,是2026年企业AI落地的核心范式。
通用人工智能(AGI)
具备与人类同等甚至超越人类水平的通用智能的AI系统。目前尚未实现,是AI领域的终极目标。2026年有争议是否已接近。
AI偏见(AI Bias)
AI模型从训练数据中学习和放大的社会偏见。包括性别、种族、地域等偏见,是AI伦理的核心问题。
AI在金融领域的应用(AI Finance)
AI在量化交易、风控、反欺诈、智能投顾、客服等金融场景的应用。金融是AI应用最深入的行业之一。
AI for Science(AI赋能科研)
用AI加速科学发现的新范式——从蛋白质结构预测到新药研发、材料设计,AI正在成为科学家的"超级研究助手"。
AI治理(AI Governance)
管理 AI 系统开发、部署和使用的政策、流程和监督框架。EU AI Act 推动 AI 治理成为企业刚需。
AI在医疗领域的应用(AI Healthcare)
AI在医学影像分析、药物研发、临床诊断辅助、健康管理等领域的应用。是AI最受期待也最受监管的方向之一。
AI原生(AI Native)
从设计之初就以AI为核心而非后期添加AI功能的产品理念。AI不仅是功能,而是产品的基础架构和用户体验的核心。
AI操作系统(AI OS)
以AI为核心的下一代操作系统概念。AI不再是一个应用,而是深度集成到系统层面,理解用户意图并主动协助完成跨应用任务。
AI安全与对齐(AI Safety)
确保AI系统的行为符合人类价值观和利益。包括防止有害输出、避免偏见、保障隐私、防范滥用等。是AI发展的核心议题之一。
自动驾驶(Autonomous Driving)
AI在交通领域的终极应用。利用计算机视觉、传感器融合和决策规划,让汽车实现自主驾驶。
浏览器智能体(Browser Agent)
能自主打开网页、点击、填表、滚动并完成线上任务的AI智能体,代表如OpenAI Operator、Google Project Mariner等,是AI落地的重要入口。
计算机使用(Computer Use)
让AI像人一样操作电脑屏幕、点击和输入来完成任务的智能体能力,Anthropic 2024年推出Computer Use API开启这一方向。
深度研究(Deep Research)
AI 自主并行阅读数十到数百个网页、PDF 或论文,在 15-30 分钟内生成结构化引用报告。是 2025-2026 年主流 AI 产品新范式。
深度伪造(Deepfake)
利用深度学习生成的以假乱真的伪造音视频,既能用于娱乐创作,也带来身份冒用、虚假信息等重大风险。
数字员工(Digital Worker)
以AI智能体形式承担具体岗位职责的“虚拟员工”,能接任务、走流程、交付结果,是2025年后企业AI落地的主要形态。
具身智能(Embodied AI)
拥有物理身体的 AI 系统,能将感知、推理与物理行动结合。人形机器人、自动驾驶、无人机是典型应用。
涌现能力(Emergent Abilities)
大模型规模超过某个临界点后突然出现的、小模型不具备的能力(如思维链、多步推理),由Google 2022年论文系统描述。
扩展思考(Extended Thinking)
让模型在作答前先进行更长时间的内部推理和自查,从而提升复杂任务正确率的模式,Claude、Gemini等主流模型均支持。
3D高斯泼溅(3D Gaussian Splatting)
用大量可学习的3D高斯椭球表示场景并实时渲染的技术,2023年提出,凭借高质量与高速渲染正成为3D重建的新标准。
人在回路(Human-in-the-loop)
在AI自动处理流程中保留人类审核、决策环节的设计模式,兼顾效率与可靠性,常用于医疗、金融等高风险场景。
多智能体系统(Multi-Agent System)
多个 AI Agent 各司其职、相互协作完成复杂任务的系统架构。比单一 Agent 更可靠、更可扩展,是 2026 年 Agent 技术的主流方向。
原生多模态(Native Multimodality)
模型在统一架构里同时处理文本、图像、音频、视频等模态的AI范式,对比外挂式多模态理解更连贯,是旗舰模型的新方向。
端侧AI(On-Device AI)
AI 模型直接在手机、电脑、IoT 设备本地运行,无需云端。2026年苹果智能、高通骁龙、微软 Copilot+ PC 推动端侧AI成为主流。
开源AI生态(Open Source AI Ecosystem)
由开源AI模型、工具、框架、数据集和社区组成的庞大生态系统。2026年,开源AI在某些领域已接近甚至超越闭源方案。
物理AI(Physical AI)
把AI从屏幕带到现实世界、能感知和操控物理环境的智能系统,机器人、自动驾驶、智能工厂是其主要载体。
量子机器学习(Quantum Machine Learning)
将量子计算与机器学习相结合的前沿方向,利用量子叠加、纠缠等特性加速数据处理与模型训练。目前仍处于早期探索阶段。
文生视频(Sora)
OpenAI于2024年推出的文生视频AI模型,能根据文字描述生成最长达60秒的高质量视频。代表了AI视频生成技术的重大突破。
主权AI(Sovereign AI)
国家或地区自主掌控算力、数据、模型和人才以发展本土AI的战略概念,NVIDIA CEO黄仁勋2024年提出并大力推动。
空间智能(Spatial Intelligence)
让AI理解、推理并与三维物理世界互动的能力,被视为语言、视觉之后的下一个前沿,李飞飞创办的World Labs正押注于此。
超级对齐(Superalignment)
OpenAI于2023年发起的长期研究项目,目标是在超级智能出现前解决“让AI安全对齐人类意图”的问题。
测试时计算(Test-Time Compute)
在模型使用阶段(而非训练阶段)投入更多计算资源以提升答案质量。是 o1/o3 推理模型和 Extended Thinking 的理论基础,2026 年重塑了 AI 的成本结构。
Transformer vs Mamba(状态空间模型对比)
Transformer是当前AI的绝对主流架构,但Mamba等状态空间模型(SSM)以线性复杂度处理长序列,可能成为下一代架构。
可信AI(Trusted AI)
强调透明、可解释、可靠、公平、安全的AI体系——让AI在医疗、金融、政务等高风险场景中值得信赖。
垂直智能体(Vertical AI Agent)
聚焦医疗、法律、金融等单一行业深度定制的AI智能体,懂行业术语和业务规则,比通用助手更容易在企业中落地。
氛围编程(Vibe Coding)
2025年由Andrej Karpathy提出的编程新范式——用自然语言描述想法,AI生成代码,开发者只需review和微调。"完全沉浸在氛围中,忘记代码的存在"。
世界模型(World Model)
能理解和模拟物理世界规律的 AI 模型——能预测物体的运动、光照的变化、力的作用。是视频生成和机器人的共同基础。
世界模拟器(World Simulator)
能模拟真实世界动态过程的AI模型,根据指令生成可控、连贯、符合物理规律的运动画面,是通往世界模型的重要方向。
硬件设施
万卡集群(10K-GPU Cluster)
由上万张GPU组成、用于训练超大模型的超级计算集群。国产大模型训练普遍采用万卡规模,比拼的是系统工程能力。
AI芯片(AI Chip)
专为AI计算设计的处理器统称,包括GPU、NPU、TPU等类型。NVIDIA主导AI训练市场,国产芯片正在快速追赶。
智算中心(AI Data Center)
专门为AI训练和推理建造的数据中心,配备GPU集群、高速网络与液冷系统,是AI时代的新型算力基础设施。
存算一体(Computing-in-Memory)
将数据存储与计算融合在同一物理器件的芯片技术,用于打破“冯·诺依曼瓶颈”,被看作AI芯片能效的下一代突破口。
神经形态计算(Neuromorphic Computing)
模拟人脑神经元与突触工作方式的芯片与算法方向,追求超低功耗的类脑智能。代表有Intel Loihi、IBM TrueNorth等。
应用场景
3D生成(3D Generation)
用文本、图片或视频提示自动生成三维模型与场景的AI技术,正在大幅降低游戏、影视、电商等行业的3D内容制作门槛。
AI音乐生成(AI Music Generation)
用文字、旋律或参考片段生成完整歌曲和配乐的AI技术,Suno等工具让不懂乐理的人也能直接产出成品音乐。
语音识别(ASR)
把人类语音自动转写成文字的AI技术,支撑语音输入、字幕、会议转写与语音助手,清晰语音的识别准确率已接近真人水平。
数字人(Digital Human)
由AI驱动的虚拟人物形象,能说话、对口型、做动作并实时互动,广泛应用于直播带货、客服、新闻播报与品牌代言。
图生图(Image-to-Image)
以已有图片为底图,按文字提示重绘、换风格、局部编辑或扩展画面的AI图像技术,是设计师和内容创作者的高频工作流。
文本转语音(TTS)
把文字转换成自然语音的AI技术,从早期机械音进化到如今近乎真人,支撑语音助手、有声书与实时语音交互等应用。
声音克隆(Voice Cloning)
用少量音频样本复制某人音色、语气生成语音的AI技术,几十秒素材即可完成克隆,已进入有声书、配音等行业。
安全治理
AI伦理(AI Ethics)
研究AI开发与应用中道德原则与价值冲突的交叉领域,涵盖偏见、隐私、责任、就业等议题,是AI治理与立法的思想基础。
AI水印(AI Watermarking)
给AI生成内容嵌入不可见标识的技术,用于事后溯源和AI生成内容识别,正被各国监管要求推动走向落地应用。
数据投毒(Data Poisoning)
攻击者通过向训练数据中注入恶意样本,从而污染AI模型行为的安全威胁,可导致模型输出偏见、错误结果或被植入后门。
深度合成(Deep Synthesis)
利用深度学习等算法生成、编辑或篡改音视频内容的技术总称,属国内监管用语,涵盖AI换脸、语音合成、文生视频等。
差分隐私(Differential Privacy)
2006年由Dwork等人提出的隐私保护框架,通过向查询结果注入受控噪声,让个体数据“淹没”在统计结果中。
AI护栏(Guardrails)
为AI应用设置的安全边界和输出控制机制,防止模型生成有害、违规、不准确内容,是企业AI上线前必须考虑的安全层。
隐私计算(Privacy Computing)
在保护数据隐私前提下完成计算任务的技术总称,涵盖联邦学习、差分隐私、安全多方计算、可信执行环境等路线。
🔗 探索更多 AI 工具板块
除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。