Type: concept
Confidence: 0.80
Created: 2026-04-25
Updated: 2026-04-25
Tags: ai-engineeringllmarchitectureAI工程

Language Model

概述

语言模型是用于预测文本序列概率分布的人工智能模型,现代大规模语言模型(LLM)能够理解和生成自然语言。

关键内容

  1. 基本原理
  2. 语言模型的目标是学习 P(output | input) 的条件概率分布
  3. 通过在大规模文本语料上训练,学习语言的统计规律
  4. Transformer 架构中的注意力机制使得模型能够捕捉长距离依赖关系

  5. 模型规模与能力

  6. < 1B 参数:Prompt 效果不稳定,few-shot 几乎无效
  7. 1B-10B:基础指令跟随能力
  8. 10B-100B:CoT 开始稳定工作
  9. 100B:复杂推理、元认知、指令跟随达到实用级别

  10. 涌现能力

  11. 随着参数规模超过某个阈值,模型展现出零样本推理、指令跟随等涌现能力
  12. 这些能力在小规模模型中不存在或很弱

来源

相关