🧠

推理(Inference)

Inference
基础概念
模型运行ML基础

推理(Inference)是 AI 模型生命周期的第二阶段——模型完成训练后,用它来处理新数据、做出预测或生成内容的过程。

训练 vs 推理

| 维度 | 训练 (Training) | 推理 (Inference) | |------|----------------|-----------------| | 目的 | 学习参数 | 使用模型 | | 计算量 | 极高(数周/数月) | 较低(毫秒/秒级) | | 数据方向 | 前向+反向传播 | 仅前向传播 | | 硬件 | 数千 GPU 集群 | 单卡或端侧设备 | | 频率 | 一次/定期 | 每次使用 |

推理的关键指标

TTFT(Time To First Token)、TPS(Tokens Per Second)、吞吐量(Throughput)、延迟(Latency)。

推理优化技术(2026年关键)

KV Cache、推测解码、批处理、Flash Attention、量化。

成本考量

推理是 AI 应用的主要运营成本。推理模型在 Extended Thinking 模式下消耗大量隐藏推理 token,用户看不到但需付费。

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。

0