📖 AI 词典

96 个核心AI概念,从入门到精通,一文读懂人工智能

基础概念

🤖

大语言模型(LLM)

通过海量文本训练的AI模型,能理解和生成自然语言。如GPT-5、Claude 4、DeepSeek-V3等。

Large Language Model
🎨

文生图(Text-to-Image)

通过文字描述自动生成图片的AI技术。代表工具有Midjourney、DALL·E 3、Stable Diffusion等。

Text-to-Image Generation
💻

AI编程(AI Coding)

利用AI辅助编写、补全、调试代码的技术。代表工具有Cursor、GitHub Copilot、Claude Code等。

AI-Assisted Programming
🕵️

智能体(AI Agent)

能自主感知环境、制定计划、使用工具并执行任务的AI系统,被Bill Gates称为"继图形界面之后最大的计算范式变革"。

AI Agent / Intelligent Agent
🪙

词元(Token)

AI处理文本的最小单位。一个Token约等于0.75个英文单词或1-2个中文字。API按Token数量计费。

Token
🌈

多模态AI(Multimodal AI)

能同时理解和处理文字、图片、音频、视频等多种类型数据的AI系统。GPT-5、Gemini 2.5、Claude 4都是多模态模型。

Multimodal AI
🔓

开源模型 vs 闭源模型(Open Source vs Closed Source)

开源模型可免费下载使用和修改(如DeepSeek、Llama),闭源模型通过API提供服务(如GPT-5、Claude 4)。各有优劣。

Open Source vs Closed Source AI Models
🌪️

AI幻觉(Hallucination)

AI自信地生成看似合理但事实错误的内容。所有LLM都存在幻觉问题,是无法完全消除的固有特性,但可以通过RAG等技术大幅减少。

AI Hallucination
🔗

模型上下文协议(MCP)

Anthropic于2024年推出的开放协议,标准化了AI应用与外部工具/数据源的连接方式。被广泛视为AI Agent生态的"USB-C接口"。

Model Context Protocol
🖼️

稳定扩散(Stable Diffusion)

Stability AI开发的开源文生图模型,2022年发布后引爆了AI绘画革命。生态最为丰富,支持ControlNet、LoRA等无数扩展。

Stable Diffusion
🐋

深度求索(DeepSeek)

中国AI公司,以极高的性价比和开源策略闻名。DeepSeek-V3和R1系列在多项基准上比肩GPT-5,但API价格仅为1/10。

DeepSeek
🎭

Claude(Anthropic)

Anthropic公司开发的AI助手系列,以安全性、长上下文、优秀的写作和编程能力著称。Claude 4是2026年最强的AI模型之一。

Claude by Anthropic
💬

ChatGPT / GPT系列

OpenAI开发的对话AI和语言模型系列。ChatGPT于2022年11月发布,引爆了全球AI热潮。GPT-5是2026年旗舰模型。

ChatGPT / GPT Series by OpenAI
💎

Gemini(Google)

Google开发的AI模型系列,以原生多模态和极长上下文窗口著称。Gemini 2.5 Pro支持100万tokens上下文,是2026年最强的模型之一。

Gemini by Google
🧠

GPT系列(OpenAI)

OpenAI开发的生成式预训练Transformer模型系列,从GPT-1到GPT-5,持续引领AI语言模型的发展。

GPT Series by OpenAI
🦙

Llama(Meta)

Meta发布的开源大语言模型系列,从Llama 1到Llama 4,是开源AI生态的基石之一。

Llama by Meta
🏮

通义千问(Qwen)

阿里巴巴通义实验室开发的大模型系列,中文能力一流,开源版本被广泛使用。Qwen3是2026年最优秀的开源中文模型之一。

Qwen / Tongyi Qianwen by Alibaba
🖱️

Cursor(AI编辑器)

AI原生代码编辑器,基于VS Code深度定制。支持自然语言编程、多文件编辑、上下文感知,是Vibe Coding的代表工具。

Cursor AI Editor
🤝

GitHub Copilot(AI编程助手)

GitHub和OpenAI联合推出的AI编程助手,2021年首发,开创了AI辅助编程的先河。全球已有超过200万开发者使用。

GitHub Copilot
🔎

Perplexity(AI搜索)

AI原生搜索引擎,2022年发布。用对话方式回答搜索问题,每条陈述都标注来源链接,被广泛视为Google杀手之一。

Perplexity AI
🪟

上下文窗口(Context Window)

AI模型一次能处理的最大文本长度,以tokens为单位。从早期的4K到现在的100万+tokens,决定了对长文档的处理能力。

Context Window
🎯

零样本/少样本学习(Zero-shot / Few-shot)

模型在没有或仅有少量示例的情况下完成任务的能力。是评估大模型智能水平的核心指标,也是 Prompt Engineering 的理论基础。

Zero-shot / Few-shot Learning
📚

小语言模型(SLM)

参数量在数亿到数十亿级别的精简语言模型,追求在有限资源下的最佳性能。与 LLM(千亿参数)形成互补,是 2026 年端侧AI 和成本敏感场景的主力。

Small Language Model
🧠

推理(Inference)

训练好的 AI 模型进行预测或生成输出的过程。每次调用 ChatGPT、生成一张 AI 图片,都是推理。

Inference

生成式AI(Generative AI)

能够创造全新内容(文字、图片、代码、音频、视频)的AI,ChatGPT、Midjourney、Suno都属于生成式AI。

Generative AI
📊

机器学习(Machine Learning)

让计算机从数据中自动学习规律、而非靠人工编写规则的人工智能分支,是现代AI的核心。

Machine Learning

技术原理

🔍

检索增强生成(RAG)

Retrieval-Augmented Generation,先检索外部知识再生成回答的技术,有效减少AI幻觉,提升回答准确性。

Retrieval-Augmented Generation
🧮

向量嵌入(Embedding)

将文字、图片、音频等非结构化数据转换为固定长度的数字向量,让计算机能够"理解"和比较语义相似度。

Vector Embedding
⚙️

Transformer架构(转换器)

2017年Google提出的神经网络架构,通过自注意力机制(Self-Attention)并行处理序列数据,是现代所有大语言模型的基石。

Transformer Architecture
🌫️

扩散模型(Diffusion Model)

一种生成模型,通过逐步"去噪"将随机噪声转化为高质量图像。Stable Diffusion、DALL·E、Midjourney都基于此技术。

Diffusion Model
🔧

微调(Fine-tuning)

在预训练模型的基础上,用特定领域数据继续训练,使其适应特定任务或风格。是AI定制化的核心技术手段。

Fine-tuning
🎮

强化学习(Reinforcement Learning)

AI通过与环境的交互和试错来学习最优策略。RLHF(人类反馈强化学习)是让ChatGPT等模型变得更"听话"的关键技术。

Reinforcement Learning
🪶

低秩适应(LoRA)

一种高效的模型微调方法,只训练少量额外参数而非修改整个模型。让个人开发者在消费级显卡上也能微调大模型。

Low-Rank Adaptation
🛠️

函数调用(Function Calling)

让AI模型能够调用外部函数/API的能力。AI不再只是"说话",而是能"做事"——查天气、发邮件、操作数据库。

Function Calling / Tool Use
🧪

知识蒸馏(Knowledge Distillation)

将大模型(教师)的知识"蒸馏"到小模型(学生)中的技术。让小模型获得接近大模型的能力,同时运行更快、成本更低。

Knowledge Distillation
🧩

混合专家模型(MoE)

一种模型架构,由多个"专家"子模型和一个路由器组成。每次只激活部分专家,在保持大模型能力的同时大幅降低推理成本。

Mixture of Experts
👨‍🏫

人类反馈强化学习(RLHF)

用人类偏好数据训练奖励模型,再用强化学习优化AI输出。是让ChatGPT、Claude等模型"懂礼貌、听指令、更安全"的核心技术。

Reinforcement Learning from Human Feedback
🧩

混合专家模型(Mixture of Experts)

一种模型架构,由多个'专家'子模型和一个路由器组成。每次只激活部分专家,大幅降低推理成本。

Mixture of Experts (MoE)
🏗️

预训练(Pre-training)

在海量通用数据上训练基础模型的过程。所有大模型的第一阶段训练,之后才进行微调或对齐。

Pre-training
📉

梯度下降(Gradient Descent)

机器学习的核心优化算法。通过计算损失函数的梯度,指导模型参数向误差最小的方向更新。

Gradient Descent
🎯

过拟合与正则化(Overfitting & Regularization)

过拟合指模型在训练数据上表现完美但在新数据上表现差。正则化是防止过拟合的技术集合。

Overfitting and Regularization
🏭

合成数据(Synthetic Data)

由AI生成而非人工采集的训练数据。2025-2026年已成为大模型训练的重要组成部分,用于解决数据枯竭问题。

Synthetic Data
🔄

反向传播(Backpropagation)

训练神经网络的核心算法。通过链式法则从输出层向输入层反向计算梯度,高效更新所有参数。

Backpropagation
🏷️

数据标注(Data Labeling)

为训练数据添加标签、分类、注释的过程。是监督学习和RLHF的关键环节,决定了模型的上限。

Data Labeling / Annotation
📦

模型量化(Quantization)

将模型参数从高精度(FP16/FP32)压缩到低精度(INT8/INT4),大幅降低显存占用和推理成本,精度损失极小。

Model Quantization
👁️

注意力机制(Attention Mechanism)

让模型在处理一个词时关注输入中的其他相关词。是Transformer架构的核心,也是现代AI最关键的发明之一。

Attention Mechanism
🏛️

Transformer架构详解(Attention Is All You Need)

Transformer架构的深入解析,涵盖Encoder-Decoder结构、位置编码、残差连接、层归一化等关键组件。

Transformer Architecture in Depth

闪电注意力(Flash Attention)

通过IO意识的算法设计大幅降低注意力计算的显存占用,让长上下文推理成为可能。是 2022-2026 年最重要的注意力计算优化之一。

Flash Attention
🔐

联邦学习(Federated Learning)

一种分布式机器学习方法,模型在本地设备上训练,只上传梯度更新而非原始数据,从而保护用户隐私。在医疗、金融、键盘输入法等场景广泛应用。

Federated Learning
🔗

思维链(Chain of Thought / CoT)

让大模型「一步步思考」的提示技术,能显著提升复杂推理任务的准确率。是推理模型(如o1、DeepSeek-R1)的核心机制。

Chain of Thought
⚔️

生成对抗网络(GAN)

由生成器和判别器相互博弈训练的经典生成模型架构,曾是图像生成的主流方法。

Generative Adversarial Network
🔄

迁移学习(Transfer Learning)

将在一个任务上学到的知识应用到另一个相关任务的技术,是 Fine-tuning 的理论基础。

Transfer Learning

推测解码(Speculative Decoding)

用小模型「草拟」、大模型「审核」的推理加速技术,可在不损失质量的前提下将生成速度提升 2-3 倍。

Speculative Decoding

使用技巧

✍️

提示词工程(Prompt Engineering)

设计和优化输入给AI的提示词(Prompt),以获得更准确、更有用的输出结果。被称为"与AI对话的艺术"。

Prompt Engineering
🔌

应用程序接口(API)

让不同软件系统相互通信的接口。几乎所有AI服务都通过API提供,开发者通过API将AI能力集成到自己的应用中。

Application Programming Interface

事实对齐(Grounding)

让AI的输出基于真实数据源而非凭空生成的技术方法。结合RAG和实时搜索,确保AI回答的事实准确性。

Grounding / Factual Alignment
⛓️

LangChain / LangGraph(LLM应用开发框架)

最流行的LLM应用开发框架。LangChain提供链式调用抽象,LangGraph提供状态图工作流。是构建AI Agent的标准工具。

LangChain / LangGraph
🎯

提示词注入(Prompt Injection)

通过精心构造的输入,诱导AI忽略原有指令或泄露系统Prompt的攻击方式。是AI应用面临的主要安全威胁之一。

Prompt Injection
📋

AI代码审查(AI Code Review)

利用AI自动审查代码质量、发现Bug和安全漏洞。比人工审查更全面、更快速,已成为现代开发流程的标准环节。

AI Code Review
📊

AI模型评测(Benchmark)

用标准化测试衡量AI模型能力的系统。MMLU、HumanEval、AIME等评测榜单是选择AI模型的重要参考,但不能完全反映实际使用体验。

AI Model Benchmark / Evaluation
🌡️

温度参数(Temperature)

控制AI输出随机性的参数。Temperature=0输出最确定,Temperature=1输出更有创意。是调节AI创造力的旋钮。

Temperature Parameter
📓

Jupyter Notebook(交互式编程环境)

交互式编程环境,支持代码、文字、图表混合展示。AI研究和教学的事实标准工具,每天有数百万人使用。

Jupyter Notebook
🔴

AI红队测试(Red Teaming)

组织安全专家尝试攻击和突破AI模型的安全防护,发现漏洞后修补。源自军事领域的红军对抗概念。

AI Red Teaming
📋

OpenAPI / Swagger(API规范)

REST API的描述标准,用JSON/YAML格式定义API接口。几乎所有AI API都提供OpenAPI规范文档。

OpenAPI Specification
🎐

AI编排(AI Orchestration)

连接和协调多个 AI 模型、工具和数据源的中间层。是 2026 年企业 AI 部署的必需层,解决「用哪个模型、怎么用、多少钱」的核心问题。

AI Orchestration

基础设施

🖥️

图形处理器(GPU)

AI训练和推理的核心硬件。NVIDIA GPU占据AI计算市场90%以上份额,是"AI时代的石油"。

Graphics Processing Unit
🗄️

向量数据库(Vector Database)

专门存储和检索向量(数值数组)的数据库,是RAG系统和语义搜索的核心基础设施。支持"找最相似的内容"这种查询。

Vector Database
💎

神经网络处理器(NPU)

专为AI推理设计的低功耗处理器,集成在手机和PC芯片中。让AI在设备本地运行而非依赖云端,实现离线AI能力。

Neural Processing Unit
🤗

HuggingFace(抱抱脸)

AI领域的"GitHub"。提供模型托管、数据集管理、训练部署、社区协作的一站式平台。是全球最大的AI模型和数据集仓库。

Hugging Face
🚀

vLLM推理引擎

UC Berkeley开发的高性能LLM推理引擎。通过PagedAttention等技术,推理速度比HuggingFace快10-20倍。

vLLM Inference Engine
🦙

Ollama(本地大模型运行框架)

最流行的本地LLM一键部署工具。一条命令下载并运行开源模型,支持macOS/Linux/Windows。

Ollama
🗜️

GGUF模型格式

llama.cpp项目定义的模型文件格式,专为CPU推理和量化设计。是本地运行大模型最主流的文件格式。

GGUF Model Format
🔥

PyTorch(深度学习框架)

Meta开发的深度学习框架,2026年已成为AI开发的事实标准。动态计算图、Pythonic API、庞大的社区生态。

PyTorch
🟢

CUDA并行计算平台

NVIDIA的并行计算平台和编程模型,是AI训练的绝对标准。几乎所有深度学习框架都运行在CUDA之上。

CUDA / Compute Unified Device Architecture
🔲

张量处理器(TPU)

Google自研的AI专用芯片,针对TensorFlow和JAX做了极致优化。在Google Cloud上训练和推理大模型的专属硬件。

Tensor Processing Unit

算力(Computing Power)

AI训练和推理所需的计算能力,以FLOPs衡量。算力是AI发展的三大支柱(算力、数据、算法)之首,被类比为AI时代的石油。

AI Computing Power

前沿概念

🧠

通用人工智能(AGI)

具备与人类同等甚至超越人类水平的通用智能的AI系统。目前尚未实现,是AI领域的终极目标。2026年有争议是否已接近。

Artificial General Intelligence
🎬

文生视频(Sora)

OpenAI于2024年推出的文生视频AI模型,能根据文字描述生成最长达60秒的高质量视频。代表了AI视频生成技术的重大突破。

Sora / Text-to-Video Generation

Transformer vs Mamba(状态空间模型对比)

Transformer是当前AI的绝对主流架构,但Mamba等状态空间模型(SSM)以线性复杂度处理长序列,可能成为下一代架构。

Transformer vs Mamba / State Space Models
🛡️

AI安全与对齐(AI Safety)

确保AI系统的行为符合人类价值观和利益。包括防止有害输出、避免偏见、保障隐私、防范滥用等。是AI发展的核心议题之一。

AI Safety and Alignment
🌱

AI原生(AI Native)

从设计之初就以AI为核心而非后期添加AI功能的产品理念。AI不仅是功能,而是产品的基础架构和用户体验的核心。

AI Native
🖥️

AI操作系统(AI OS)

以AI为核心的下一代操作系统概念。AI不再是一个应用,而是深度集成到系统层面,理解用户意图并主动协助完成跨应用任务。

AI Operating System
🎵

氛围编程(Vibe Coding)

2025年由Andrej Karpathy提出的编程新范式——用自然语言描述想法,AI生成代码,开发者只需review和微调。"完全沉浸在氛围中,忘记代码的存在"。

Vibe Coding
🌍

开源AI生态(Open Source AI Ecosystem)

由开源AI模型、工具、框架、数据集和社区组成的庞大生态系统。2026年,开源AI在某些领域已接近甚至超越闭源方案。

Open Source AI Ecosystem
⚖️

AI偏见(AI Bias)

AI模型从训练数据中学习和放大的社会偏见。包括性别、种族、地域等偏见,是AI伦理的核心问题。

AI Bias
🏥

AI在医疗领域的应用(AI Healthcare)

AI在医学影像分析、药物研发、临床诊断辅助、健康管理等领域的应用。是AI最受期待也最受监管的方向之一。

AI in Healthcare
💰

AI在金融领域的应用(AI Finance)

AI在量化交易、风控、反欺诈、智能投顾、客服等金融场景的应用。金融是AI应用最深入的行业之一。

AI in Finance
🚗

自动驾驶(Autonomous Driving)

AI在交通领域的终极应用。利用计算机视觉、传感器融合和决策规划,让汽车实现自主驾驶。

Autonomous Driving / Self-Driving Cars

测试时计算(Test-Time Compute)

在模型使用阶段(而非训练阶段)投入更多计算资源以提升答案质量。是 o1/o3 推理模型和 Extended Thinking 的理论基础,2026 年重塑了 AI 的成本结构。

Test-Time Compute / Inference-Time Compute
🤖

智能体RAG(Agentic RAG)

将 AI Agent 的自主决策能力与 RAG 的检索增强结合,让模型能主动多轮搜索、验证、整合信息。是 2026 年 RAG 的主流进化方向。

Agentic RAG
🔍

深度研究(Deep Research)

AI 自主并行阅读数十到数百个网页、PDF 或论文,在 15-30 分钟内生成结构化引用报告。是 2025-2026 年主流 AI 产品新范式。

Deep Research
🧩

多智能体系统(Multi-Agent System)

多个 AI Agent 各司其职、相互协作完成复杂任务的系统架构。比单一 Agent 更可靠、更可扩展,是 2026 年 Agent 技术的主流方向。

Multi-Agent System (MAS)
🌍

世界模型(World Model)

能理解和模拟物理世界规律的 AI 模型——能预测物体的运动、光照的变化、力的作用。是视频生成和机器人的共同基础。

World Model
📱

端侧AI(On-Device AI)

AI 模型直接在手机、电脑、IoT 设备本地运行,无需云端。2026年苹果智能、高通骁龙、微软 Copilot+ PC 推动端侧AI成为主流。

On-Device AI / Edge AI
🦾

具身智能(Embodied AI)

拥有物理身体的 AI 系统,能将感知、推理与物理行动结合。人形机器人、自动驾驶、无人机是典型应用。

Embodied AI
⚖️

AI治理(AI Governance)

管理 AI 系统开发、部署和使用的政策、流程和监督框架。EU AI Act 推动 AI 治理成为企业刚需。

AI Governance

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。

0