【中阶·云原生】如何让 vLLM 推理性能翻倍:从 PagedAttention 原理到 K8S 全栈调度的性能工程实战
【中阶·云原生】如何让 vLLM 推理性能翻倍:从 PagedAttention 原理到 K8S 全栈调度的性能工程实战 专栏:《AI 工程与安全深度实战》· ...
【中阶·云原生】如何让 vLLM 推理性能翻倍:从 PagedAttention 原理到 K8S 全栈调度的性能工程实战 专栏:《AI 工程与安全深度实战》· ...
如何用服务器日志判断 AI 爬虫是否访问过你的网站 摘要 做 GEO 不能只看“感觉 AI 好像收录了”。更可靠的方法是直接分析服务器访问日志:哪...
国产AI芯片实战:海光DCU K100-AI服务器部署DeepSeek-R1-Distill全指南 在国产化AI基础设施建设的浪潮中,海光DCU K100-A...

配置 两台8*64的昇腾910b4服务器物理机,未做任何虚拟化,已经通过交换机进行互联 模型和镜像下载 模型: ...
面向移动端与边缘设备的vLLM轻量化部署方案探索:模型蒸馏与裁剪的协同路径 随着生成式人工智能技术的快速发展,大语言模型...

前言:2025年是大模型“百模大战”转入“推理落地”的关键一年。DeepSeek V3、Llama 3 70B 等开源权重的发布,让...

文章目录 一、LLAMA-Factory简介二、安装LLaMA-Factory三、准备训练数据四、模型训练1. 模型下载2. 全量微调3.lora微调4.QLo...
做工业大模型项目,最容易踩的坑就是 “盲目堆技术”—— 上来就选最大参数的模型、最复杂的架构,最后要么部署不了,要么效果不达标。尤其是转行 / 没项目经验的朋友...

文章浏览阅读1k次,点赞25次,收藏10次。基于AutoDL服务器(单卡),通过vllm发布Lora微调模型的API服务,在本地进行调用_lora的模型,vll...

文章浏览阅读1.1k次,点赞11次,收藏17次。无论部署在何种环境中,红帽AI推理服务器都为用户提供经过强化并获得官方支持的vLLM发行版,配套智能LLM压缩工...