
摘要:本文深入讲解 LLM 的三种主流接入方式——API 接入、本地部署接入、SDK 接入,从环境准备到代码实战,手把手教你将大模型能力集成到自己的应用中。文章包含完整的代码示例、优缺点对比和常见问题分析,助你根据业务场景选择最合适的接入方案。
一、LLM 的接入方式
在前面的章节中,我们已经系统了解了大语言模型的基本概念、核心能力和提示词编写技巧。那么,如何将这些强大的能力真正接入到自己的项目或产品中呢?
目前业界主流的 LLM 接入方式有三种:
|
API 接入 |
低 |
按量付费 |
数据上传至服务商 |
快速验证、中小规模应用 |
|
本地接入 |
高 |
硬件投入大 |
完全本地可控 |
隐私要求高、大规模应用 |
|
SDK 接入 |
中 |
按需付费 |
取决于 SDK 提供商 |
移动端/桌面端应用集成 |
下面我们将逐一深入讲解每种接入方式的完整流程。
1.1 API 接入
API(Application Programming Interface)接入是最简单、最快速的方式,适合绝大多数开发者和企业快速集成大模型能力。
1.1.1 主流 LLM API 概览
|
OpenAI |
platform.openai.com |
能力最强,生态最完善 |
按 token 计费 |
|
Anthropic |
docs.anthropic.com |
长上下文,安全性高 |
按 token 计费 |
|
阿里云(通义千问) |
help.aliyun.com |
国内访问稳定,中文优化 |
按 token 计费 |
|
百度智能云(文心) |
cloud.baidu.com |
中文理解强,搜索融合 |
按 token 计费 |
|
DeepSeek |
platform.deepseek.com |
开源模型,性价比极高 |
按 token 计费 |
|
月之暗面(Kimi) |
platform.moonshot.cn |
超长上下文,文档处理强 |
按 token 计费 |
|
讯飞星火 |
xinghuo.xfyun.cn |
语音能力强 |
按 token 计费 |
|
硅基流动 / OneAPI |
– |
统一聚合接口,切换方便 |
各平台原价 |
1.1.2以deepseek为例接入
1.申请API Key

2.查阅API文档
了解请求的端点、参数(如模型名称、提示词、温度、最大生成长度等)和返回的数据格式。

3.构建 HTTP 请求
在你的代码中,使用 HTTP 客户端库(如 Python 的 requests)构建一个包含 API Key(通常在 Header 中)和请求体(JSON 格式,包含你的提示和参数)的请求。
1.下载apifox
https://apifox.com/
下载进入
1、

2、

3、

https://api.deepseek.com/v1/chat/completions
4、

5、

6、

7、

1.2 本地接入
大模型本地部署,这种方式就是将开源的大型语言模型(如 Llama、ChatGLM、Qwen 等)部署在你自己的硬件环境(本地服务器或私有云)中。核心概念就是,将下载模型的文件(权重和配置文件),使用专门的推理框架在本地服务器或 GPU 上加载并运行模型,然后通过类似 API 的方式进行交互。
典型流程是:
- vLLM:特别注重高吞吐量的推理服务,性能极佳。
- TGI:Hugging Face 推出的推理框架,功能全面。
- Ollama:非常用户友好,可以一键拉取和运行模型,适合快速入门和本地开发。
- LM Studio:提供图形化界面,让本地运行模型像使用软件一样简单。
以 Ollama 为例,下面我们来演示下具体过程。
1.1.1 本地部署的核心挑战
|
硬件要求 |
大模型需要 GPU/TPU,显存需求大 |
|
显存计算 |
每 10 亿参数约需 2~4GB 显存(FP16) |
|
推理速度 |
本地硬件可能不如云端 API 快 |
|
运维成本 |
需要自行维护模型、框架、驱动 |
显存需求参考表:
|
Llama 3 |
8B |
~16GB |
~8GB |
~4GB |
|
Llama 3 |
70B |
~140GB |
~70GB |
~35GB |
|
Qwen2 |
7B |
~14GB |
~7GB |
~3.5GB |
|
Qwen2 |
72B |
~144GB |
~72GB |
~36GB |
|
DeepSeek |
7B |
~14GB |
~7GB |
~3.5GB |
1.1.2 使用 Ollama 快速本地部署(最简单)
Ollama 是目前最简单的本地大模型运行工具,一行命令即可启动:
1.下载并安装ollama
Ollama 官⽹: https://ollama.ai

2.验证
安装完成后,Ollama 默认会启动。
访问: http://127.0.0.1:11434

3.拉取模型
# 拉取并运行模型
ollama run llama3 # 运行 Llama 3 8B
ollama run qwen2 # 运行通义千问 2
ollama run deepseek-coder # 运行 DeepSeek Coder
# 列出已下载的模型
ollama list
# API 方式调用本地模型
curl http://localhost:11434/api/generate -d '{
"model": "llama3",
"prompt": "你好,请介绍一下自己"
}'


4.运行模型
ollama run + 自己拉取的模型完整名

5.通过接口调用
curl "http://127.0.0.1:11434/api/chat" \\
-d '{
"model": "deepseek-r1:1.5b",
"messages":[
{"role": "user", "content": "夸夸我"}
],
"stream": false
}'

1.3 SDK接入
这并非一种独立的接入方式,而是对第一种 API 接入的封装和简化。模型提供商通常会发布官方编程语言 SDK,为我们封装好了底层的 HTTP 请求细节,提供一个更符合编程习惯的、语言特定的函数库。
典型流程(以 Deepseek Python SDK 为例):
DeepSeek 的接口完全兼容 OpenAI 接口协议,无需单独安装 DeepSeek 专属 SDK,直接使用 openai 官方 SDK 即可调用:
1.3.1 安装依赖库
pip install openai
1.3.2 打开编译器建一个python文件
1.3.3 发送HTTP请求
直接复制到文件中
from openai import OpenAI
client = OpenAI(
api_key="你的DeepSeek密钥",
base_url="https://api.deepseek.com" # 对接DeepSeek接口地址
)
res = client.chat.completions.create(
model="deepseek-chat", # 模型:deepseek-chat通用对话 / deepseek-reasoner推理模型
messages=[{"role": "user", "content": "你好"}]
)
print(res.choices[0].message.content)

二、问题与思考
1. 三种接入方式如何选择?
2. 原生 LLM 无论哪种接入方式都存在限制,原因:
1. 输入长度限制
所有 LLM 都有固定的输入长度(如 4K、8K、128K、400K Token)。我们无法将一本几百页的 PDF 或整个公司知识库直接塞给模型。 示例:GPT-5 最大拥有 400000 上下文窗口大小。
2. 缺乏私有知识
模型的训练数据有截止日期,且不包含我们的私人数据(如公司内部文档、个人笔记等)。让它基于这些知识回答问题,非常困难。
3. 复杂任务处理能力弱
原生 API 本质是一个「一问一答」的接口。对于需要多个步骤的复杂任务(如「分析这份财报,总结要点,并生成一份 PPT 大纲」),需要自行编写复杂逻辑拆解任务、多次调用 API 并管理中间状态。
4. 输出格式不可控
虽然可以通过提示词要求模型输出 JSON 或特定格式,但模型仍可能产生格式错误或不合规内容,需要自行编写后处理代码校验和清洗。
文末补充:像 LangChain 这类框架,正是为系统性解决以上问题而诞生。
网硕互联帮助中心






评论前必须登录!
注册