LOGO 首页 OA教程 ERP教程 模切知识交流 PMS教程 CRM教程 技术文档 其他文档  
 
网站管理员

大模型应用基础知识

freeflydom
2026年8月5日 10:12 本文热度 48

1. Token(词元)

定义

大模型处理文本的最小基础单位,不是单纯汉字 / 单词,是模型词表预拆分后的片段,英文、中文拆分规则不同。

换算规则

  • 英文:4 个字符 ≈ 1 Token,0.75 个英文单词 ≈ 1 Token
  • 中文:1 个汉字 ≈ 1.5~2 Token(中文编码成本更高)
  • 符号、空格、标点都会单独占用 Token

核心作用

  1. 计费标准:所有 LLM API 按输入 Token、输出 Token 分别计价,输出通常更贵
  2. 长度计量:上下文窗口、最大生成长度全部以 Token 为单位
  3. 输入过长会触发截断,丢失前文信息

2. 上下文窗口 Context Window

定义

模型单次推理能同时读取、记忆、参考的最大 Token 总容量,等同于模型的短期工作记忆上限

包含内容

一次请求内全部 Token 总和:历史对话 + 系统提示词 Prompt + 用户当前提问 + 已生成的回答内容。

关键特性

  1. 硬限制:由模型架构决定(4K/8K/32K/128K / 百万级),无法无限扩容;窗口越大,显存、算力消耗呈平方级上涨
  2. 溢出处理:Token 总量超限后,最早的对话内容会被截断丢弃,模型彻底遗忘早期信息,出现回答断片、逻辑丢失
  3. 业务价值:窗口越大,越适合长文档解读、多轮超长对话、代码全文件分析

3. Temperature 温度参数

定义

控制模型生成文字的随机发散程度,取值范围 0.0 ~ 2.0,默认 1.0,底层通过缩放预测分数 logits 调整概率分布。

不同取值效果

  • Temperature ≈ 0(0.1~0.3):概率分布极度陡峭,只选最高概率 Token;输出严谨、重复少、无脑洞,适合代码、数学计算、事实问答、数据抽取
  • Temperature = 0.5~0.7:平衡稳定与多样性,通用聊天、翻译、普通文案首选
  • Temperature ≥ 1.0(1.0~1.5):分布变平缓,低概率词汇更容易出现;创意更强,适合小说、写诗、头脑风暴;过高容易产生幻觉、逻辑混乱

公式原理

调整后概率 = softmax(logits / temperature)

4. Top-p 核采样(Nucleus Sampling)

定义

动态截断候选词池:将所有预测 Token 按概率从高到低累加,只保留累积概率总和达到 p 的词汇集合,其余低概率长尾词直接丢弃。取值 0.0 ~ 1.0,默认 1.0(不截断)。

取值效果

  • Top-p=0.1~0.5:仅保留极少数高确信词汇,输出严谨统一,适合专业问答
  • Top-p=0.8~0.95:保留绝大多数主流合理词汇,兼顾自然度与多样性,日常对话标配
  • Top-p=1:等价不限制候选词,全部词汇参与采样

和 Temperature 区别

  • Temperature:整体缩放全部词汇的概率高低,改变随机倾向
  • Top-p:直接过滤掉低概率冷门词汇,控制可选词汇范围 工程最佳实践:二者不要同时大幅调高,一般固定一个微调另一个。

5. 流式输出 Stream

定义

SSE(服务器推送事件)流式推理,模型逐 Token 实时返回生成片段,不用等完整回答生成完毕再一次性返回结果。

工作流程

  1. API 请求开启 stream=True
  2. 服务端每生成 1 个 Token 就推送一条小块数据 chunk
  3. 客户端持续接收delta增量文本,实时拼接展示
  4. 全部生成完成后推送结束标识

优势

  • 用户体验:打字机实时效果,消除长时间空白等待
  • 低延迟:长回答场景感知速度提升数倍

是否开启流式

绝大多数前端聊天场景:必须开流式(stream=True)
后端批量 / 程序自动化场景:关闭流式(stream=False)
原因:

  1. 代码逻辑更简单,一次性拿到完整文本,不用循环拼接每一段 chunk;
  2. 不需要实时展示,后台静默处理,追求简洁代码;
  3. 要对完整结果做正则、JSON 解析、校验,一次性返回更方便。
    特殊工具调用(Function Calling)建议
    流式开启:工具调用参数会分段吐出,需要代码拼接完整 JSON 才能解析调用;
    流式关闭:直接拿到完整工具调用结构,解析更省事。
    如果你的业务大量依赖工具联网、查数据,很多开发者会临时关流式。

Function Calling 函数调用(工具调用)

定义

大模型自主识别用户意图,自动生成外部函数 / API 调用参数,交给开发者本地执行工具,再把工具结果传回模型整合输出自然语言,打通模型与外部真实数据、系统操作的能力。

完整执行四步流程

  1. 函数注册:开发者定义工具,提供函数名、功能描述、入参 JSON Schema 传给模型
  2. 意图判断:用户提问后,模型判断是否需要调用外部工具(查天气、数据库、联网搜索)
  3. 生成调用指令:模型返回标准化函数名 + 结构化参数,不生成自然文本
  4. 执行回填 + 二次生成:本地代码执行函数拿到结果,将数据塞回上下文,模型结合工具数据给出最终回答

典型应用场景

  • 实时信息:天气、股票、新闻、航班查询
  • 系统操作:数据库增删查改、设备控制、邮件发送
  • 智能 Agent:多工具链式调用、复杂任务自动化

核心价值

解决大模型知识截止、无法访问实时数据、不能操作外部系统三大短板,是智能体 Agent 的底层核心能力。

阅读原文:点击这里


该文章在 2026/8/5 10:12:31 编辑过
关键字查询
相关文章
正在查询...
点晴ERP是一款针对中小制造业的专业生产管理软件系统,系统成熟度和易用性得到了国内大量中小企业的青睐。
点晴PMS码头管理系统主要针对港口码头集装箱与散货日常运作、调度、堆场、车队、财务费用、相关报表等业务管理,结合码头的业务特点,围绕调度、堆场作业而开发的。集技术的先进性、管理的有效性于一体,是物流码头及其他港口类企业的高效ERP管理信息系统。
点晴WMS仓储管理系统提供了货物产品管理,销售管理,采购管理,仓储管理,仓库管理,保质期管理,货位管理,库位管理,生产管理,WMS管理系统,标签打印,条形码,二维码管理,批号管理软件。
点晴免费OA是一款软件和通用服务都免费,不限功能、不限时间、不限用户的免费OA协同办公管理系统。
Copyright 2010-2026 ClickSun All Rights Reserved  粤ICP备13012886号-9  粤公网安备44030602007207号