📖 AI 词典

183 个核心AI概念,从入门到精通,一文读懂人工智能

基础概念

🕵️

智能体(AI Agent)

能自主感知环境、制定计划、使用工具并执行任务的AI系统,被Bill Gates称为"继图形界面之后最大的计算范式变革"。

AI Agent / Intelligent Agent
💻

AI编程(AI Coding)

利用AI辅助编写、补全、调试代码的技术。代表工具有Cursor、GitHub Copilot、Claude Code等。

AI-Assisted Programming
🌪️

AI幻觉(Hallucination)

AI自信地生成看似合理但事实错误的内容。所有LLM都存在幻觉问题,是无法完全消除的固有特性,但可以通过RAG等技术大幅减少。

AI Hallucination
💬

ChatGPT / GPT系列

OpenAI开发的对话AI和语言模型系列。ChatGPT于2022年11月发布,引爆了全球AI热潮。GPT-5是2026年旗舰模型。

ChatGPT / GPT Series by OpenAI
🎭

Claude(Anthropic)

Anthropic公司开发的AI助手系列,以安全性、长上下文、优秀的写作和编程能力著称。Claude 4是2026年最强的AI模型之一。

Claude by Anthropic
👁️

计算机视觉(Computer Vision)

让计算机"看懂"图像和视频的人工智能领域,人脸识别、自动驾驶、医学影像分析都是它的应用。

Computer Vision
🪟

上下文窗口(Context Window)

AI模型一次能处理的最大文本长度,以tokens为单位。从早期的4K到现在的100万+tokens,决定了对长文档的处理能力。

Context Window
🖱️

Cursor(AI编辑器)

AI原生代码编辑器,基于VS Code深度定制。支持自然语言编程、多文件编辑、上下文感知,是Vibe Coding的代表工具。

Cursor AI Editor
🧠

深度学习(Deep Learning)

使用多层神经网络从数据中自动学习特征的机器学习方法,是大语言模型、图像识别等现代AI的技术底座。

Deep Learning
🐋

深度求索(DeepSeek)

中国AI公司,以极高的性价比和开源策略闻名。DeepSeek-V3和R1系列在多项基准上比肩GPT-5,但API价格仅为1/10。

DeepSeek
💎

Gemini(Google)

Google开发的AI模型系列,以原生多模态和极长上下文窗口著称。Gemini 2.5 Pro支持100万tokens上下文,是2026年最强的模型之一。

Gemini by Google
✨

生成式AI(Generative AI)

能够创造全新内容(文字、图片、代码、音频、视频)的AI,ChatGPT、Midjourney、Suno都属于生成式AI。

Generative AI
🤝

GitHub Copilot(AI编程助手)

GitHub和OpenAI联合推出的AI编程助手,2021年首发,开创了AI辅助编程的先河。全球已有超过200万开发者使用。

GitHub Copilot
🧠

GPT系列(OpenAI)

OpenAI开发的生成式预训练Transformer模型系列,从GPT-1到GPT-5,持续引领AI语言模型的发展。

GPT Series by OpenAI
🧠

推理(Inference)

训练好的 AI 模型进行预测或生成输出的过程。每次调用 ChatGPT、生成一张 AI 图片,都是推理。

Inference
🦙

Llama(Meta)

Meta发布的开源大语言模型系列,从Llama 1到Llama 4,是开源AI生态的基石之一。

Llama by Meta
🤖

大语言模型(LLM)

通过海量文本训练的AI模型,能理解和生成自然语言。如GPT-5、Claude 4、DeepSeek-V3等。

Large Language Model
📊

机器学习(Machine Learning)

让计算机从数据中自动学习规律、而非靠人工编写规则的人工智能分支,是现代AI的核心。

Machine Learning
🔗

模型上下文协议(MCP)

Anthropic于2024年推出的开放协议,标准化了AI应用与外部工具/数据源的连接方式。被广泛视为AI Agent生态的"USB-C接口"。

Model Context Protocol
⚙️

模型参数(Parameters)

大模型内部可学习的数值,决定模型的知识容量与能力边界,常以“7B、70B、千亿”描述规模,如GPT-3有1750亿参数。

Model Parameters
🌈

多模态AI(Multimodal AI)

能同时理解和处理文字、图片、音频、视频等多种类型数据的AI系统。GPT-5、Gemini 2.5、Claude 4都是多模态模型。

Multimodal AI
💬

自然语言处理(NLP)

让计算机理解、生成和处理人类语言的人工智能分支,ChatGPT 等大模型的底层能力都源于NLP。

Natural Language Processing
🔓

开源模型 vs 闭源模型(Open Source vs Closed Source)

开源模型可免费下载使用和修改(如DeepSeek、Llama),闭源模型通过API提供服务(如GPT-5、Claude 4)。各有优劣。

Open Source vs Closed Source AI Models
🔎

Perplexity(AI搜索)

AI原生搜索引擎,2022年发布。用对话方式回答搜索问题,每条陈述都标注来源链接,被广泛视为Google杀手之一。

Perplexity AI
🏮

通义千问(Qwen)

阿里巴巴通义实验室开发的大模型系列,中文能力一流,开源版本被广泛使用。Qwen3是2026年最优秀的开源中文模型之一。

Qwen / Tongyi Qianwen by Alibaba
📚

小语言模型(SLM)

参数量在数亿到数十亿级别的精简语言模型,追求在有限资源下的最佳性能。与 LLM(千亿参数)形成互补,是 2026 年端侧AI 和成本敏感场景的主力。

Small Language Model
🖼️

稳定扩散(Stable Diffusion)

Stability AI开发的开源文生图模型,2022年发布后引爆了AI绘画革命。生态最为丰富,支持ControlNet、LoRA等无数扩展。

Stable Diffusion
🏷️

监督与无监督学习(Supervised/Unsupervised Learning)

机器学习的两种基本训练范式:监督学习用带标签数据学"标准答案",无监督学习从无标签数据中发现隐藏规律。

Supervised & Unsupervised Learning
🎨

文生图(Text-to-Image)

通过文字描述自动生成图片的AI技术。代表工具有Midjourney、DALL·E 3、Stable Diffusion等。

Text-to-Image Generation
🪙

词元(Token)

AI处理文本的最小单位。一个Token约等于0.75个英文单词或1-2个中文字。API按Token数量计费。

Token
🎯

零样本/少样本学习(Zero-shot / Few-shot)

模型在没有或仅有少量示例的情况下完成任务的能力。是评估大模型智能水平的核心指标,也是 Prompt Engineering 的理论基础。

Zero-shot / Few-shot Learning

技术原理

🤝

A2A协议(Agent2Agent)

让不同厂商的AI智能体之间互相发现、通信和协作的开放协议,Google于2025年发布,被视为"智能体的TCP/IP"。

Agent2Agent Protocol (A2A)
🛡️

对抗攻击(Adversarial Attack)

通过精心构造的微小扰动欺骗AI模型、使其产生错误输出的攻击手段,是AI安全与鲁棒性研究的核心课题。

Adversarial Attack
📏

智能体评测(Agent Evaluation)

衡量AI智能体任务完成能力的评测体系,与传统大模型评测不同,它关注多步任务、工具使用和长期目标的达成质量。

Agent Evaluation
🧠

智能体记忆(Agent Memory)

让AI智能体跨会话记住用户偏好、历史行为和任务上下文的记忆系统,是智能体从"工具"走向"协作者"的关键能力。

Agent Memory
👁️

注意力机制(Attention Mechanism)

让模型在处理一个词时关注输入中的其他相关词。是Transformer架构的核心,也是现代AI最关键的发明之一。

Attention Mechanism
🔄

反向传播(Backpropagation)

训练神经网络的核心算法。通过链式法则从输出层向输入层反向计算梯度,高效更新所有参数。

Backpropagation
🔤

BERT

Google于2018年发布的预训练语言模型,通过双向上下文理解文本,是NLP预训练时代的里程碑。

BERT (Bidirectional Encoder Representations from Transformers)
🧨

灾难性遗忘(Catastrophic Forgetting)

模型在学习新任务时把旧知识“冲掉”的现象,是持续学习和增量微调面临的经典难题,微调不当会明显损害模型原有能力。

Catastrophic Forgetting
🔗

思维链(Chain of Thought / CoT)

让大模型「一步步思考」的提示技术,能显著提升复杂推理任务的准确率。是推理模型(如o1、DeepSeek-R1)的核心机制。

Chain of Thought
✂️

文本分块(Chunking)

将长文档切分为语义完整的小块文本的技术,是RAG系统的第一道工序。分块策略直接决定检索质量与问答效果。

Chunking
🖼️

卷积神经网络(CNN)

通过卷积操作自动提取图像特征的神经网络架构,是图像识别、人脸识别、自动驾驶视觉的核心技术。

Convolutional Neural Network
🗜️

上下文压缩(Context Compression)

把大段上下文压缩成摘要或关键信息后再交给模型,节省token、降低成本,让有限的上下文窗口承载更多有效信息。

Context Compression
🧩

上下文工程(Context Engineering)

系统性地设计、筛选和编排输入给模型的上下文信息,让模型在有限上下文窗口里获得最相关材料,从而输出更准确的结果。

Context Engineering
🏷️

数据标注(Data Labeling)

为训练数据添加标签、分类、注释的过程。是监督学习和RLHF的关键环节,决定了模型的上限。

Data Labeling / Annotation
🌫️

扩散模型(Diffusion Model)

一种生成模型,通过逐步"去噪"将随机噪声转化为高质量图像。Stable Diffusion、DALL·E、Midjourney都基于此技术。

Diffusion Model
🎬

扩散Transformer(DiT)

把扩散模型的去噪骨干从卷积网络换成Transformer的生成架构,2024年后成为文生图、视频生成等领域的技术主流。

Diffusion Transformer
👍

直接偏好优化(DPO)

让模型直接学习“哪个回答更好”的偏好数据,无需训练奖励模型和复杂强化学习,比RLHF更简单高效的对齐方法。

Direct Preference Optimization
🧮

向量嵌入(Embedding)

将文字、图片、音频等非结构化数据转换为固定长度的数字向量,让计算机能够"理解"和比较语义相似度。

Vector Embedding
🔐

联邦学习(Federated Learning)

一种分布式机器学习方法,模型在本地设备上训练,只上传梯度更新而非原始数据,从而保护用户隐私。在医疗、金融、键盘输入法等场景广泛应用。

Federated Learning
🔧

微调(Fine-tuning)

在预训练模型的基础上,用特定领域数据继续训练,使其适应特定任务或风格。是AI定制化的核心技术手段。

Fine-tuning
⚡

闪电注意力(Flash Attention)

通过IO意识的算法设计大幅降低注意力计算的显存占用,让长上下文推理成为可能。是 2022-2026 年最重要的注意力计算优化之一。

Flash Attention
🏗️

基础模型(Foundation Model)

在大规模数据上预训练、可适配多种下游任务的通用大模型,GPT、Claude、Gemini、Llama都是基础模型。

Foundation Model
🛠️

函数调用(Function Calling)

让AI模型能够调用外部函数/API的能力。AI不再只是"说话",而是能"做事"——查天气、发邮件、操作数据库。

Function Calling / Tool Use
⚔️

生成对抗网络(GAN)

由生成器和判别器相互博弈训练的经典生成模型架构,曾是图像生成的主流方法。

Generative Adversarial Network
📉

梯度下降(Gradient Descent)

机器学习的核心优化算法。通过计算损失函数的梯度,指导模型参数向误差最小的方向更新。

Gradient Descent
🕸️

图增强检索(GraphRAG)

将知识图谱与RAG结合的技术方案,通过实体与关系结构帮助模型完成多跳推理。微软2023年提出并开源了相关实现。

GraphRAG
📊

组相对策略优化(GRPO)

让模型针对同一问题生成多份回答,以组内相对优劣作为奖励信号的强化学习算法,是DeepSeek训练推理模型的核心技术。

Group Relative Policy Optimization
🔎

混合检索(Hybrid Search)

在同一搜索系统中同时使用关键词检索与向量语义检索的搜索方式,兼顾精确匹配与语义理解,是RAG系统的常用配置。

Hybrid Search
📖

上下文学习(In-context Learning)

大模型不更新参数、仅通过提示中给出的示例就学会完成新任务的能力,是零样本/少样本学习的关键机制。

In-context Learning (ICL)
🗣️

指令微调(Instruction Tuning)

用大量“指令-回答”数据微调模型,让它学会理解并遵循各类指令,是让大模型从文本预测器变成通用助手的关键一步。

Instruction Tuning
🔍

AI可解释性(Interpretability)

研究AI决策过程和内部机制如何被人理解的技术方向,目标是让“黑盒”模型变得透明可信,是AI合规与安全的前提。

Interpretability
🧪

知识蒸馏(Knowledge Distillation)

将大模型(教师)的知识"蒸馏"到小模型(学生)中的技术。让小模型获得接近大模型的能力,同时运行更快、成本更低。

Knowledge Distillation
⚡

KV缓存(KV Cache)

大模型推理时缓存已计算过的注意力中间结果,避免重复计算,是让长文本对话和长上下文生成变快、变便宜的关键优化。

KV Cache
🪶

低秩适应(LoRA)

一种高效的模型微调方法,只训练少量额外参数而非修改整个模型。让个人开发者在消费级显卡上也能微调大模型。

Low-Rank Adaptation
🧩

混合专家模型(Mixture of Experts)

一种模型架构,由多个'专家'子模型和一个路由器组成。每次只激活部分专家,大幅降低推理成本。

Mixture of Experts (MoE)
🔀

模型路由(Model Routing)

根据任务难度和需求,把请求智能分配给最合适的模型(大模型或小模型),在保证效果的同时降低成本、提升速度。

Model Routing
🧩

混合专家模型(MoE)

一种模型架构,由多个"专家"子模型和一个路由器组成。每次只激活部分专家,在保持大模型能力的同时大幅降低推理成本。

Mixture of Experts
🕸️

神经网络(Neural Network)

受大脑神经元启发、由大量相互连接的"人工神经元"组成的计算模型,是深度学习和现代AI的基本单元。

Neural Network
🎯

过拟合与正则化(Overfitting & Regularization)

过拟合指模型在训练数据上表现完美但在新数据上表现差。正则化是防止过拟合的技术集合。

Overfitting and Regularization
📍

位置编码(Positional Encoding)

给Transformer注入词语顺序信息的技术。因并行处理丢失语序,需额外编码位置;旋转位置编码(RoPE)是当前主流方案。

Positional Encoding
🏗️

预训练(Pre-training)

在海量通用数据上训练基础模型的过程。所有大模型的第一阶段训练,之后才进行微调或对齐。

Pre-training
📦

模型量化(Quantization)

将模型参数从高精度(FP16/FP32)压缩到低精度(INT8/INT4),大幅降低显存占用和推理成本,精度损失极小。

Model Quantization
🔍

检索增强生成(RAG)

Retrieval-Augmented Generation,先检索外部知识再生成回答的技术,有效减少AI幻觉,提升回答准确性。

Retrieval-Augmented Generation
🧮

ReAct模式(推理+行动)

让大模型交替进行“思考→行动→观察”循环的智能体范式,2022年论文提出后成为构建AI Agent的主流框架。

ReAct
🧩

推理模型(Reasoning Model)

具备深度逻辑推理能力的大模型,能"想清楚再回答",代表如OpenAI o系列、DeepSeek-R1、Claude Opus等。

Reasoning Model / LRM
🎮

强化学习(Reinforcement Learning)

AI通过与环境的交互和试错来学习最优策略。RLHF(人类反馈强化学习)是让ChatGPT等模型变得更"听话"的关键技术。

Reinforcement Learning
📊

重排序(Reranking)

检索流程中对候选文档进行精细排序的技术。先用轻量方法粗召回,再用重排序模型精排,显著提升检索与问答质量。

Reranking
🏆

奖励模型(Reward Model)

给AI回答打分的模型,用来预测“这个回答人类是否喜欢”,是RLHF等对齐训练中扮演“裁判”角色的关键组件。

Reward Model
👨‍🏫

人类反馈强化学习(RLHF)

用人类偏好数据训练奖励模型,再用强化学习优化AI输出。是让ChatGPT、Claude等模型"懂礼貌、听指令、更安全"的核心技术。

Reinforcement Learning from Human Feedback
🎯

可验证奖励强化学习(RLVR)

在数学、编程等有明确对错的任务上,用自动校验代替人类打分作为奖励的强化学习方法,是DeepSeek-R1等推理模型的关键技术。

RLVR (Reinforcement Learning from Verifiable Rewards)
🔁

循环神经网络(RNN)

一种擅长处理文本、语音等序列数据的神经网络,靠循环传递的隐藏状态记忆历史信息。LSTM、GRU是其著名改进版,如今多被Transformer取代。

Recurrent Neural Network
📈

规模法则(Scaling Laws)

描述大模型性能随参数、数据、算力增长而提升的规律,是“大力出奇迹”路线的理论依据,由OpenAI 2020年研究系统化提出。

Scaling Laws
👁️

自注意力机制(Self-Attention)

让输入序列中每个词都与其他所有词交互、按相关性分配权重的机制,能有效捕捉长距离依赖,是Transformer架构的核心基石。

Self-Attention
🔄

编码器-解码器架构(Seq2Seq)

由编码器读入输入、解码器生成输出的序列转换框架,曾统治机器翻译等任务,也是Transformer的经典形态,深刻影响了现代大模型。

Encoder-Decoder / Seq2Seq
📚

监督微调(SFT)

用人工标注的“问题-答案”数据继续训练基础模型,让它学会对话和指令遵循,是让模型从“会预测”走向“会用”的关键步骤。

Supervised Fine-Tuning
🕸️

稀疏注意力(Sparse Attention)

让每个词只关注部分重要位置而非全部位置的注意力优化方案,能大幅降低长文本处理成本,是扩展上下文窗口的关键技术之一。

Sparse Attention
⚡

推测解码(Speculative Decoding)

用小模型「草拟」、大模型「审核」的推理加速技术,可在不损失质量的前提下将生成速度提升 2-3 倍。

Speculative Decoding
🏭

合成数据(Synthetic Data)

由AI生成而非人工采集的训练数据。2025-2026年已成为大模型训练的重要组成部分,用于解决数据枯竭问题。

Synthetic Data
🔄

迁移学习(Transfer Learning)

将在一个任务上学到的知识应用到另一个相关任务的技术,是 Fine-tuning 的理论基础。

Transfer Learning
🏛️

Transformer架构详解(Attention Is All You Need)

Transformer架构的深入解析,涵盖Encoder-Decoder结构、位置编码、残差连接、层归一化等关键组件。

Transformer Architecture in Depth
⚙️

Transformer架构(转换器)

2017年Google提出的神经网络架构,通过自注意力机制(Self-Attention)并行处理序列数据,是现代所有大语言模型的基石。

Transformer Architecture
🎭

变分自编码器(VAE)

一种生成模型,把数据压缩到有规律的低维潜空间并从中采样生成新数据,训练稳定可控,是文生图、AI音乐等领域的重要基石。

Variational Autoencoder

使用技巧

🎯

答案引擎优化(AEO)

让网页内容被AI答案引擎直接摘录为"标准答案"并标注来源的优化策略,与GEO共同构成AI搜索时代的内容方法论。

Answer Engine Optimization
📊

AI模型评测(Benchmark)

用标准化测试衡量AI模型能力的系统。MMLU、HumanEval、AIME等评测榜单是选择AI模型的重要参考,但不能完全反映实际使用体验。

AI Model Benchmark / Evaluation
📋

AI代码审查(AI Code Review)

利用AI自动审查代码质量、发现Bug和安全漏洞。比人工审查更全面、更快速,已成为现代开发流程的标准环节。

AI Code Review
🎐

AI编排(AI Orchestration)

连接和协调多个 AI 模型、工具和数据源的中间层。是 2026 年企业 AI 部署的必需层,解决「用哪个模型、怎么用、多少钱」的核心问题。

AI Orchestration
🔌

应用程序接口(API)

让不同软件系统相互通信的接口。几乎所有AI服务都通过API提供,开发者通过API将AI能力集成到自己的应用中。

Application Programming Interface
📡

生成引擎优化(GEO)

针对AI搜索引擎(如Perplexity、AI Overview)优化内容,让品牌和网页被AI答案引用、推荐的策略,被称为"SEO的下一代"。

Generative Engine Optimization
⚓

事实对齐(Grounding)

让AI的输出基于真实数据源而非凭空生成的技术方法。结合RAG和实时搜索,确保AI回答的事实准确性。

Grounding / Factual Alignment
🔓

越狱(Jailbreak)

通过精心构造的提示词绕过AI安全限制、诱导其输出违规内容的攻击手法,是AI安全攻防的核心课题。

Jailbreak
📓

Jupyter Notebook(交互式编程环境)

交互式编程环境,支持代码、文字、图表混合展示。AI研究和教学的事实标准工具,每天有数百万人使用。

Jupyter Notebook
⛓️

LangChain / LangGraph(LLM应用开发框架)

最流行的LLM应用开发框架。LangChain提供链式调用抽象,LangGraph提供状态图工作流。是构建AI Agent的标准工具。

LangChain / LangGraph
📋

OpenAPI / Swagger(API规范)

REST API的描述标准,用JSON/YAML格式定义API接口。几乎所有AI API都提供OpenAPI规范文档。

OpenAPI Specification
💾

提示词缓存(Prompt Caching)

把重复使用的提示前缀缓存起来、只按增量计费的技术,可让多轮对话和Agent应用的成本降低高达90%。

Prompt Caching
✍️

提示词工程(Prompt Engineering)

设计和优化输入给AI的提示词(Prompt),以获得更准确、更有用的输出结果。被称为"与AI对话的艺术"。

Prompt Engineering
🎯

提示词注入(Prompt Injection)

通过精心构造的输入,诱导AI忽略原有指令或泄露系统Prompt的攻击方式。是AI应用面临的主要安全威胁之一。

Prompt Injection
🔴

AI红队测试(Red Teaming)

组织安全专家尝试攻击和突破AI模型的安全防护,发现漏洞后修补。源自军事领域的红军对抗概念。

AI Red Teaming
⚙️

系统提示词(System Prompt)

定义AI角色、行为规则和输出约束的底层指令,独立于用户消息,决定AI"以什么身份和规矩"工作。

System Prompt
🌡️

温度参数(Temperature)

控制AI输出随机性的参数。Temperature=0输出最确定,Temperature=1输出更有创意。是调节AI创造力的旋钮。

Temperature Parameter

基础设施

💻

AI PC

内置NPU等AI加速单元、能在本地直接运行大模型的个人电脑,无需联网即可用AI,是端侧AI的重要载体。

AI PC
⚡

算力(Computing Power)

AI训练和推理所需的计算能力,以FLOPs衡量。算力是AI发展的三大支柱(算力、数据、算法)之首,被类比为AI时代的石油。

AI Computing Power
🟢

CUDA并行计算平台

NVIDIA的并行计算平台和编程模型,是AI训练的绝对标准。几乎所有深度学习框架都运行在CUDA之上。

CUDA / Compute Unified Device Architecture
🗜️

GGUF模型格式

llama.cpp项目定义的模型文件格式,专为CPU推理和量化设计。是本地运行大模型最主流的文件格式。

GGUF Model Format
🖥️

图形处理器(GPU)

AI训练和推理的核心硬件。NVIDIA GPU占据AI计算市场90%以上份额,是"AI时代的石油"。

Graphics Processing Unit
🤗

HuggingFace(抱抱脸)

AI领域的"GitHub"。提供模型托管、数据集管理、训练部署、社区协作的一站式平台。是全球最大的AI模型和数据集仓库。

Hugging Face
💎

神经网络处理器(NPU)

专为AI推理设计的低功耗处理器,集成在手机和PC芯片中。让AI在设备本地运行而非依赖云端,实现离线AI能力。

Neural Processing Unit
🦙

Ollama(本地大模型运行框架)

最流行的本地LLM一键部署工具。一条命令下载并运行开源模型,支持macOS/Linux/Windows。

Ollama
🔥

PyTorch(深度学习框架)

Meta开发的深度学习框架,2026年已成为AI开发的事实标准。动态计算图、Pythonic API、庞大的社区生态。

PyTorch
🖥️

超节点(Supernode)

把成百上千颗AI芯片深度整合成一台巨型超级计算机的算力方案,是2026年世界人工智能大会的产业风向标热词。

Supernode
🔲

张量处理器(TPU)

Google自研的AI专用芯片,针对TensorFlow和JAX做了极致优化。在Google Cloud上训练和推理大模型的专属硬件。

Tensor Processing Unit
🗄️

向量数据库(Vector Database)

专门存储和检索向量(数值数组)的数据库,是RAG系统和语义搜索的核心基础设施。支持"找最相似的内容"这种查询。

Vector Database
🚀

vLLM推理引擎

UC Berkeley开发的高性能LLM推理引擎。通过PagedAttention等技术,推理速度比HuggingFace快10-20倍。

vLLM Inference Engine

前沿概念

🤖

代理式AI(Agentic AI)

能自主规划、调用工具、多步骤执行任务并自我纠错的AI范式,2026年最热门的AI方向,被称为"会做事的AI"。

Agentic AI
🤖

智能体编程(Agentic Coding)

让AI自主规划、多文件修改、运行调试并迭代完成软件开发任务的编程范式,代表工具如Claude Code、Devin、Cursor Agent模式等。

Agentic Coding
🤖

智能体RAG(Agentic RAG)

将 AI Agent 的自主决策能力与 RAG 的检索增强结合,让模型能主动多轮搜索、验证、整合信息。是 2026 年 RAG 的主流进化方向。

Agentic RAG
🔀

智能体工作流(Agentic Workflow)

由AI智能体自主决策、调用工具、迭代执行来完成整条业务流程的工作方式,是2026年企业AI落地的核心范式。

Agentic Workflow
🧠

通用人工智能(AGI)

具备与人类同等甚至超越人类水平的通用智能的AI系统。目前尚未实现,是AI领域的终极目标。2026年有争议是否已接近。

Artificial General Intelligence
⚖️

AI偏见(AI Bias)

AI模型从训练数据中学习和放大的社会偏见。包括性别、种族、地域等偏见,是AI伦理的核心问题。

AI Bias
💰

AI在金融领域的应用(AI Finance)

AI在量化交易、风控、反欺诈、智能投顾、客服等金融场景的应用。金融是AI应用最深入的行业之一。

AI in Finance
🔬

AI for Science(AI赋能科研)

用AI加速科学发现的新范式——从蛋白质结构预测到新药研发、材料设计,AI正在成为科学家的"超级研究助手"。

AI for Science
⚖️

AI治理(AI Governance)

管理 AI 系统开发、部署和使用的政策、流程和监督框架。EU AI Act 推动 AI 治理成为企业刚需。

AI Governance
🏥

AI在医疗领域的应用(AI Healthcare)

AI在医学影像分析、药物研发、临床诊断辅助、健康管理等领域的应用。是AI最受期待也最受监管的方向之一。

AI in Healthcare
🌱

AI原生(AI Native)

从设计之初就以AI为核心而非后期添加AI功能的产品理念。AI不仅是功能,而是产品的基础架构和用户体验的核心。

AI Native
🖥️

AI操作系统(AI OS)

以AI为核心的下一代操作系统概念。AI不再是一个应用,而是深度集成到系统层面,理解用户意图并主动协助完成跨应用任务。

AI Operating System
🛡️

AI安全与对齐(AI Safety)

确保AI系统的行为符合人类价值观和利益。包括防止有害输出、避免偏见、保障隐私、防范滥用等。是AI发展的核心议题之一。

AI Safety and Alignment
🚗

自动驾驶(Autonomous Driving)

AI在交通领域的终极应用。利用计算机视觉、传感器融合和决策规划,让汽车实现自主驾驶。

Autonomous Driving / Self-Driving Cars
🌐

浏览器智能体(Browser Agent)

能自主打开网页、点击、填表、滚动并完成线上任务的AI智能体,代表如OpenAI Operator、Google Project Mariner等,是AI落地的重要入口。

Browser Agent
🖱️

计算机使用(Computer Use)

让AI像人一样操作电脑屏幕、点击和输入来完成任务的智能体能力,Anthropic 2024年推出Computer Use API开启这一方向。

Computer Use
🔍

深度研究(Deep Research)

AI 自主并行阅读数十到数百个网页、PDF 或论文,在 15-30 分钟内生成结构化引用报告。是 2025-2026 年主流 AI 产品新范式。

Deep Research
🎭

深度伪造(Deepfake)

利用深度学习生成的以假乱真的伪造音视频,既能用于娱乐创作,也带来身份冒用、虚假信息等重大风险。

Deepfake
👷

数字员工(Digital Worker)

以AI智能体形式承担具体岗位职责的“虚拟员工”,能接任务、走流程、交付结果,是2025年后企业AI落地的主要形态。

Digital Worker
🦾

具身智能(Embodied AI)

拥有物理身体的 AI 系统,能将感知、推理与物理行动结合。人形机器人、自动驾驶、无人机是典型应用。

Embodied AI
🌟

涌现能力(Emergent Abilities)

大模型规模超过某个临界点后突然出现的、小模型不具备的能力(如思维链、多步推理),由Google 2022年论文系统描述。

Emergent Abilities
💭

扩展思考(Extended Thinking)

让模型在作答前先进行更长时间的内部推理和自查,从而提升复杂任务正确率的模式,Claude、Gemini等主流模型均支持。

Extended Thinking
✨

3D高斯泼溅(3D Gaussian Splatting)

用大量可学习的3D高斯椭球表示场景并实时渲染的技术,2023年提出,凭借高质量与高速渲染正成为3D重建的新标准。

3D Gaussian Splatting
🔄

人在回路(Human-in-the-loop)

在AI自动处理流程中保留人类审核、决策环节的设计模式,兼顾效率与可靠性,常用于医疗、金融等高风险场景。

Human-in-the-loop
🧩

多智能体系统(Multi-Agent System)

多个 AI Agent 各司其职、相互协作完成复杂任务的系统架构。比单一 Agent 更可靠、更可扩展,是 2026 年 Agent 技术的主流方向。

Multi-Agent System (MAS)
🌈

原生多模态(Native Multimodality)

模型在统一架构里同时处理文本、图像、音频、视频等模态的AI范式,对比外挂式多模态理解更连贯,是旗舰模型的新方向。

Native Multimodality
📱

端侧AI(On-Device AI)

AI 模型直接在手机、电脑、IoT 设备本地运行,无需云端。2026年苹果智能、高通骁龙、微软 Copilot+ PC 推动端侧AI成为主流。

On-Device AI / Edge AI
🌍

开源AI生态(Open Source AI Ecosystem)

由开源AI模型、工具、框架、数据集和社区组成的庞大生态系统。2026年,开源AI在某些领域已接近甚至超越闭源方案。

Open Source AI Ecosystem
🦾

物理AI(Physical AI)

把AI从屏幕带到现实世界、能感知和操控物理环境的智能系统,机器人、自动驾驶、智能工厂是其主要载体。

Physical AI
⚛️

量子机器学习(Quantum Machine Learning)

将量子计算与机器学习相结合的前沿方向,利用量子叠加、纠缠等特性加速数据处理与模型训练。目前仍处于早期探索阶段。

Quantum Machine Learning
🎬

文生视频(Sora)

OpenAI于2024年推出的文生视频AI模型,能根据文字描述生成最长达60秒的高质量视频。代表了AI视频生成技术的重大突破。

Sora / Text-to-Video Generation
🏛️

主权AI(Sovereign AI)

国家或地区自主掌控算力、数据、模型和人才以发展本土AI的战略概念,NVIDIA CEO黄仁勋2024年提出并大力推动。

Sovereign AI
🗺️

空间智能(Spatial Intelligence)

让AI理解、推理并与三维物理世界互动的能力,被视为语言、视觉之后的下一个前沿,李飞飞创办的World Labs正押注于此。

Spatial Intelligence
🛰️

超级对齐(Superalignment)

OpenAI于2023年发起的长期研究项目,目标是在超级智能出现前解决“让AI安全对齐人类意图”的问题。

Superalignment
⏳

测试时计算(Test-Time Compute)

在模型使用阶段(而非训练阶段)投入更多计算资源以提升答案质量。是 o1/o3 推理模型和 Extended Thinking 的理论基础,2026 年重塑了 AI 的成本结构。

Test-Time Compute / Inference-Time Compute
⚡

Transformer vs Mamba(状态空间模型对比)

Transformer是当前AI的绝对主流架构,但Mamba等状态空间模型(SSM)以线性复杂度处理长序列,可能成为下一代架构。

Transformer vs Mamba / State Space Models
🛡️

可信AI(Trusted AI)

强调透明、可解释、可靠、公平、安全的AI体系——让AI在医疗、金融、政务等高风险场景中值得信赖。

Trusted AI
🎯

垂直智能体(Vertical AI Agent)

聚焦医疗、法律、金融等单一行业深度定制的AI智能体,懂行业术语和业务规则,比通用助手更容易在企业中落地。

Vertical AI Agent
🎵

氛围编程(Vibe Coding)

2025年由Andrej Karpathy提出的编程新范式——用自然语言描述想法,AI生成代码,开发者只需review和微调。"完全沉浸在氛围中,忘记代码的存在"。

Vibe Coding
🌍

世界模型(World Model)

能理解和模拟物理世界规律的 AI 模型——能预测物体的运动、光照的变化、力的作用。是视频生成和机器人的共同基础。

World Model
🌍

世界模拟器(World Simulator)

能模拟真实世界动态过程的AI模型,根据指令生成可控、连贯、符合物理规律的运动画面,是通往世界模型的重要方向。

World Simulator

硬件设施

应用场景

安全治理

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。

☆ 0