03 第3周D13 LLM基础与ClaudeAPI
D13 LLM 基础与 Claude API
D13 LLM 基础与 Claude API
精讲(必讲,进入主营业务)。公司的"货"就是 Claude 的调用能力。本模块建立 LLM/API 心智模型,D14 端点验证、D15 计费全建于此。
教学目标(学完能做什么)
- 能说出 token 是什么、怎么算,输入/输出如何分开计费
- 能说出主流 Claude 模型型号与大致能力定位
- 会用 API(Python/curl)发起一次 messages 对话,含鉴权与流式
- 理解模型参数(temperature/max_tokens/stream)对调用与计费的影响
前置要求
- D3(HTTP/JSON/鉴权)、D9(Python)、D10(API 概念)
本模块在业务中的位置
- 上游:Claude 端点就是公司进货的来源。理解"调用一次 Claude API 花多少钱、返回什么",才懂后面所有计费逻辑。参考
.agent/skills/llm-endpoint-probe/SKILL.md的上下文。
内容分段
1. Token:LLM 的货币
- token = 计费与计数的基本单位:模型按 token 读输入、写输出。
- 估算:1 token ≈ 0.75 英文单词;中文大约 1 个汉字 ≈ 1~2 token。
- 计费口径:输入 token + 输出 token 分开计价,输出通常更贵。
- 为什么重要:一切成本核算、定价、余额扣减都从 token 出发(D15 展开)。
2. 模型(Claude 5 家族视角)
| 模型 | 定位 | 特点 |
|---|---|---|
| Haiku | 轻量快速 | 低延迟低成本,简单任务 |
| Sonnet | 均衡主力 | 日常开发/业务主力 |
| Opus | 最强能力 | 复杂推理,成本最高 |
- 型号会随时间演进(公司实际可用模型以 D14 拉取结果为准)。
- 记忆:快/中/强三档,价格与能力正相关。
3. 一次 Claude API 调用
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: 你的KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-sonnet-5",
"max_tokens": 100,
"messages": [{"role": "user", "content": "用一句话介绍你自己"}]
}'- 关键头:
x-api-key(鉴权)、anthropic-version(API 版本)。 - 请求体:
model/max_tokens/messages(角色 user/assistant)。 - 响应里能看到
usage字段(input_tokens/output_tokens)——这就是计费依据。
4. 用 Python SDK 调用
pip install anthropicimport anthropic
client = anthropic.Anthropic(
api_key="你的KEY",
base_url="https://api.anthropic.com", # 公司场景可能指向网关
)
msg = client.messages.create(
model="claude-sonnet-5",
max_tokens=200,
messages=[{"role": "user", "content": "你好"}],
)
print(msg.content[0].text)
print(msg.usage) # input_tokens / output_tokens5. 关键参数与计费影响
| 参数 | 作用 | 对钱的影响 |
|---|---|---|
model | 选哪个档位 | 决定单价 |
max_tokens | 输出上限 | 封顶输出量 |
temperature | 随机性(0-1) | 不影响计费,只影响质量 |
stream | 是否流式 | 不影响总额,影响体验/超时策略 |
| 上下文长度 | messages 越长 | 输入 token 越多 |
- 省钱认知:控制输入长度(精简历史)、限制 max_tokens、选对档位,是成本管理三招。
6. 流式与重试
- 流式(
stream=true):token 边生成边返回,客户体验好、超时不卡死。 - 重试:网络/5xx 时重试;429 限流要按
Retry-After退避(D14 详讲)。 - 公司网关做转发时这两点都要处理(第 4 周项目 A 会实现)。
讲解节奏建议(约 90 分钟)
| 时段 | 内容 |
|---|---|
| 09:00-09:15 | 引入:公司的货=Claude 调用能力,先懂货再谈卖 |
| 09:15-09:40 | Token 概念 + 模型三档 |
| 09:40-10:10 | curl 发起一次真实对话(讲师带 key 演示) |
| 10:10-10:35 | Python SDK + usage 字段(计费依据) |
| 10:35-10:55 | 参数对成本的影响 |
| 10:55-11:30 | 学员实操:用练习 key 调通并看 usage(对应作业) |
| 11:30-11:50 | 常见误区 + 小结 |
| 11:50-12:00 | 布置作业 |
常见误区汇总
| 误区 | 正确理解 |
|---|---|
| token 和汉字一样多 | 中文约 1 汉字≈1~2 token;英文约 0.75 词/token |
| 输出和输入一个价 | 通常输出更贵,按模型定价表 |
| 模型越强越好 | 按任务选档,省钱三招:精简输入/限输出/选对档 |
| stream 会多花钱 | 总量不变,只影响体验与超时 |
| 上游 key 随便发 | key=钱,按需分配、不落日志(D14 红线) |
| usage 不重要 | usage 是计费的原始依据,D15 直接用它扣钱 |