云计算百科
云计算领域专业知识百科平台

LLM 大模型三种主流接入方式详解(API / 本地部署 / SDK)

摘要:本文深入讲解 LLM 的三种主流接入方式——API 接入本地部署接入SDK 接入,从环境准备到代码实战,手把手教你将大模型能力集成到自己的应用中。文章包含完整的代码示例、优缺点对比和常见问题分析,助你根据业务场景选择最合适的接入方案。

一、LLM 的接入方式

在前面的章节中,我们已经系统了解了大语言模型的基本概念、核心能力和提示词编写技巧。那么,如何将这些强大的能力真正接入到自己的项目或产品中呢?

目前业界主流的 LLM 接入方式有三种:

接入方式

技术门槛

成本

数据安全

适用场景

API 接入

按量付费

数据上传至服务商

快速验证、中小规模应用

本地接入

硬件投入大

完全本地可控

隐私要求高、大规模应用

SDK 接入

按需付费

取决于 SDK 提供商

移动端/桌面端应用集成

下面我们将逐一深入讲解每种接入方式的完整流程。

1.1 API 接入

API(Application Programming Interface)接入是最简单最快速的方式,适合绝大多数开发者和企业快速集成大模型能力。

1.1.1 主流 LLM API 概览

服务商

API 文档

特点

计费方式

OpenAI

platform.openai.com

能力最强,生态最完善

按 token 计费

Anthropic

docs.anthropic.com

长上下文,安全性高

按 token 计费

阿里云(通义千问)

help.aliyun.com

国内访问稳定,中文优化

按 token 计费

百度智能云(文心)

cloud.baidu.com

中文理解强,搜索融合

按 token 计费

DeepSeek

platform.deepseek.com

开源模型,性价比极高

按 token 计费

月之暗面(Kimi)

platform.moonshot.cn

超长上下文,文档处理强

按 token 计费

讯飞星火

xinghuo.xfyun.cn

语音能力强

按 token 计费

硅基流动 / OneAPI

统一聚合接口,切换方便

各平台原价

1.1.2以deepseek为例接入

1.申请API Key

2.查阅API文档

了解请求的端点、参数(如模型名称、提示词、温度、最大生成长度等)和返回的数据格式。

3.构建 HTTP 请求

在你的代码中,使用 HTTP 客户端库(如 Python 的 requests)构建一个包含 API Key(通常在 Header 中)和请求体(JSON 格式,包含你的提示和参数)的请求。

1.下载apifox

https://apifox.com/

下载进入

1、

2、

3、

https://api.deepseek.com/v1/chat/completions

4、

5、

6、

7、

1.2 本地接入

大模型本地部署,这种方式就是将开源的大型语言模型(如 Llama、ChatGLM、Qwen 等)部署在你自己的硬件环境(本地服务器或私有云)中。核心概念就是,将下载模型的文件(权重和配置文件),使用专门的推理框架在本地服务器或 GPU 上加载并运行模型,然后通过类似 API 的方式进行交互。

典型流程是:

  • 获取模型:从 Hugging Face(国外)、魔搭社区(国内)等平台下载开源模型的权重。
  • 准备环境:配置具有足够显存(如 NVIDIA GPU)的服务器,安装必要的驱动和推理框架。
  • 选择推理框架:使用专为生产环境设计的框架来部署模型,例如:
    • vLLM:特别注重高吞吐量的推理服务,性能极佳。
    • TGI:Hugging Face 推出的推理框架,功能全面。
    • Ollama:非常用户友好,可以一键拉取和运行模型,适合快速入门和本地开发。
    • LM Studio:提供图形化界面,让本地运行模型像使用软件一样简单。
  • 启动服务并调用:框架会启动一个本地 API 服务器(如 http://localhost:8000),你可以像调用云端 API 一样向这个本地地址发送请求。
  • 以 Ollama 为例,下面我们来演示下具体过程。

    1.1.1 本地部署的核心挑战

    挑战

    说明

    硬件要求

    大模型需要 GPU/TPU,显存需求大

    显存计算

    每 10 亿参数约需 2~4GB 显存(FP16)

    推理速度

    本地硬件可能不如云端 API 快

    运维成本

    需要自行维护模型、框架、驱动

    显存需求参考表:

    模型

    参数量

    FP16 显存

    INT8 量化

    INT4 量化

    Llama 3

    8B

    ~16GB

    ~8GB

    ~4GB

    Llama 3

    70B

    ~140GB

    ~70GB

    ~35GB

    Qwen2

    7B

    ~14GB

    ~7GB

    ~3.5GB

    Qwen2

    72B

    ~144GB

    ~72GB

    ~36GB

    DeepSeek

    7B

    ~14GB

    ~7GB

    ~3.5GB

    1.1.2 使用 Ollama 快速本地部署(最简单)

    Ollama 是目前最简单的本地大模型运行工具,一行命令即可启动:

    1.下载并安装ollama

    Ollama 官⽹: https://ollama.ai

    2.验证

    安装完成后,Ollama 默认会启动。

    访问: http://127.0.0.1:11434

    3.拉取模型

    # 拉取并运行模型
    ollama run llama3 # 运行 Llama 3 8B
    ollama run qwen2 # 运行通义千问 2
    ollama run deepseek-coder # 运行 DeepSeek Coder

    # 列出已下载的模型
    ollama list

    # API 方式调用本地模型
    curl http://localhost:11434/api/generate -d '{
    "model": "llama3",
    "prompt": "你好,请介绍一下自己"
    }'

    4.运行模型

    ollama run + 自己拉取的模型完整名

    5.通过接口调用

    curl "http://127.0.0.1:11434/api/chat" \\
    -d '{
    "model": "deepseek-r1:1.5b",
    "messages":[
    {"role": "user", "content": "夸夸我"}
    ],
    "stream": false
    }'

    1.3 SDK接入

    这并非一种独立的接入方式,而是对第一种 API 接入的封装和简化。模型提供商通常会发布官方编程语言 SDK,为我们封装好了底层的 HTTP 请求细节,提供一个更符合编程习惯的、语言特定的函数库。

    典型流程(以 Deepseek Python SDK 为例):

    DeepSeek 的接口完全兼容 OpenAI 接口协议,无需单独安装 DeepSeek 专属 SDK,直接使用 openai 官方 SDK 即可调用:

    1.3.1 安装依赖库

    pip install openai

    1.3.2 打开编译器建一个python文件

    1.3.3 发送HTTP请求

    直接复制到文件中

    from openai import OpenAI

    client = OpenAI(
    api_key="你的DeepSeek密钥",
    base_url="https://api.deepseek.com" # 对接DeepSeek接口地址
    )

    res = client.chat.completions.create(
    model="deepseek-chat", # 模型:deepseek-chat通用对话 / deepseek-reasoner推理模型
    messages=[{"role": "user", "content": "你好"}]
    )
    print(res.choices[0].message.content)

    二、问题与思考

    1. 三种接入方式如何选择?

  • 看数据敏感性 如果数据极其敏感,必须留在内部,本地部署是唯一选择。
  • 看技术实力和资源 如果团队没有强大的 MLops(机器学习运维)能力,也没有预算购买和维护 GPU 服务器,云端 API 是更实际的选择。
  • 看成本和规模 如果应用规模很大,长期来看,本地部署的固定成本可能低于持续的 API 调用费用。反之,小规模应用用 API 更划算。
  • 看定制需求 如果只是使用模型的通用能力,云端 API 足够。如果需要用自己的数据微调模型,则需要选择支持微调的 API 或直接本地部署。

  • 2. 原生 LLM 无论哪种接入方式都存在限制,原因:

    1. 输入长度限制

    所有 LLM 都有固定的输入长度(如 4K、8K、128K、400K Token)。我们无法将一本几百页的 PDF 或整个公司知识库直接塞给模型。 示例:GPT-5 最大拥有 400000 上下文窗口大小。

    2. 缺乏私有知识

    模型的训练数据有截止日期,且不包含我们的私人数据(如公司内部文档、个人笔记等)。让它基于这些知识回答问题,非常困难。 

    3. 复杂任务处理能力弱

    原生 API 本质是一个「一问一答」的接口。对于需要多个步骤的复杂任务(如「分析这份财报,总结要点,并生成一份 PPT 大纲」),需要自行编写复杂逻辑拆解任务、多次调用 API 并管理中间状态。

    4. 输出格式不可控

    虽然可以通过提示词要求模型输出 JSON 或特定格式,但模型仍可能产生格式错误或不合规内容,需要自行编写后处理代码校验和清洗。

    文末补充:像 LangChain 这类框架,正是为系统性解决以上问题而诞生。

    赞(0)
    未经允许不得转载:网硕互联帮助中心 » LLM 大模型三种主流接入方式详解(API / 本地部署 / SDK)
    分享到: 更多 (0)

    评论 抢沙发

    评论前必须登录!