适用范围
- 本文针对 DDR5 SDRAM(JESD79-5 系列)的硬件电路设计,覆盖颗粒(down / 板载)与模组(UDIMM、SODIMM、RDIMM、LRDIMM)两类落地形态,速率覆盖 3200 ~ 8800 MT/s。
- 适用对象:服务器 / PC / 边缘计算 / 高端嵌入式主控(Intel、AMD、飞腾、海光、NXP、瑞萨、TI、SoC FPGA 等)的主存接口原理设计、PCB Layout、电源完整性、信号完整性与量产调试。
- 内容包含:规格对比、封装球位、信号定义、CA 命令总线协议、电源与 On-DIMM PMIC、典型电路(内联原理图)、子通道架构与训练、Layout 规范、SI 与端接、ESD 与可靠性、焊接生产、故障排查、检查清单与 BOM。
- 不包含:主控侧内存控制器微架构、BIOS/UEFI MRC 源码、完整 JEDEC 寄存器位定义。
参数效力声明
全文所有电压、电流、时序、阻抗、端接值均为工程典型值或量级参考。最终设计一律以目标型号 datasheet、目标主控 DDR 控制器设计指南(PDG / Design Guide)与 JEDEC JESD79-5 为准;不同厂商(Micron / Samsung / SK hynix / CXMT)、不同密度、不同速率档的数值存在明显差异。文中凡出现「典型」「约」「建议」均表示该值需按实际器件复核。
本系列其他文档
| SPI NOR 电路设计指南 | 串行 NOR Flash | Quad/QPI 提速、dummy cycles、XIP、DPD 低功耗 |
| SPI NAND 电路设计指南 | 串行 NAND Flash | 页/块管理、片内 ECC、坏块表、主机 FTL |
| 并行NAND (PPI NAND) 电路设计指南 | 8/16 位并行 NAND | 宽总线时序、ECC 引擎、40+ 引脚 Layout |
| eMMC 电路设计指南 | eMMC 5.0/5.1 | HS200/HS400、1.8 V VCCQ、DS 选通与等长 |
| SD NAND 电路设计指南 | 贴片式 SD NAND | SPI/SDIO 双模式、无休眠指令、VCC 负载开关断电 |
| NAND MCP 电路设计指南 | 多芯片合封存储 | 多 die 与多 CE、双电源轨、HDI 扇出 |
| 并行NOR (PPI NOR) 电路设计指南 | 并行 NOR Flash | 异步读时序、XIP、等待周期、总线扩展 |
| PSRAM 电路设计指南 | 伪静态 RAM | OPI/HyperBus、刷新与延迟周期、XIP 与帧缓存 |
| DDR2 电路设计指南 | DDR2 SDRAM | SSTL_18、T 分支拓扑、VTT 端接、ODT |
| DDR3 电路设计指南 | DDR3 / DDR3L | Fly-by 拓扑、write leveling、动态 ODT |
| DDR4 电路设计指南 | DDR4 SDRAM | POD12、bank group、DBI、2D 训练 |
| DDR5 电路设计指南 本文 | DDR5 SDRAM | 双子通道、On-DIMM PMIC、DFE、同帧 ECC |
| EEPROM 电路设计指南 | EEPROM | I²C/SPI 接口、上拉电阻与总线电容、页写与写保护 |
快速决策:DDR4 / DDR5 / LPDDR5 / GDDR 怎么选
四类易失性存储器的定位差异
| 定位 | 上一代通用主存 | 通用主存 / 服务器主存 | 移动与低功耗 SoC 主存 | 显卡 / AI 加速高带宽显存 |
| 供电 | VDD/VDDQ 1.2 V,VPP 2.5 V | VDD/VDDQ 1.1 V,VPP 1.8 V | VDD1 1.05 V / VDD2 0.9 V / VDDQ 0.5 V | VDD 1.35 V,VDDQ 1.35 V(随厂商) |
| 通道形态 | 单 64 bit(+8 ECC = 72) | 双 32 bit 子通道(各 +8 ECC = 40×2) | 每 die 16 bit,多 die 组通道 | 每颗粒 32 bit,多颗粒并行 |
| 速率 | 1600~3200 MT/s | 3200~8800+ MT/s | 5500~10700 MT/s(X 档) | 14~24 Gbps/pin |
| 电源架构 | 主板 VRM | On-DIMM PMIC(模组) | PMIC + 主控内 DVFS | 多相 VRM + 显存电源层 |
| 成本 / 功耗敏感 | 成本最低、生态成熟 | 带宽与容量密度最高 | 每 bit 功耗最低 | 带宽优先、功耗与成本最高 |
决策一句话:需要大容量 + 高带宽 + 服务器 RAS 特性→ DDR5;需要电池续航 + 小体积→ LPDDR5/LPDDR5X(含 LPCAMM2);需要极致带宽→ GDDR6/GDDR7;成本优先且速率 ≤3200→ DDR4。DDR5 的代价是电源架构变更(PMIC)、训练复杂度上升、Layout 与 SI 门槛显著提高,若主控不支持 DDR5 PHY,任何优化都无法弥补。
本文速览:DDR5 相对 DDR4 的九处本质变化
1 · 器件基础
本节给出 DDR5 与 DDR4 的规格对照、封装与球位分区、以及设计必须遵守的关键电气参数。任何一条不满足,后续 Layout 与训练都无法救回。
1.1 规格对比:DDR4 vs DDR5
| VDD / VDDQ | 1.2 V(±3% / ±5% 依档位) | 1.1 V(AC 噪声典型 ±3%) | 噪声预算从 36 mV 压到 33 mV,PDN 设计难度上升 |
| VPP(字线升压) | 2.5 V | 1.8 V | 可直接由 PMIC 一路输出供给,无需独立升压 |
| VDD 电源来源 | 主板 VRM / DC-DC | 模组上 PMIC(板载方案需自建) | 主板只送 5 V 或 12 V,需重新规划电源层 |
| 数据速率 | 1600~3200 MT/s | 3200~8800+ MT/s | Nyquist 从 1.6 GHz 升到 4.4 GHz,板材与残桩必须升级 |
| 时钟频率 | 速率 / 2(最高 1.6 GHz) | 速率 / 2(最高 4.4 GHz) | CK 抖动要求更严,差分 80 Ω 与对称布线是硬指标 |
| 通道结构 | 1 × 64 bit(ECC 时 72 bit) | 2 × 32 bit 子通道(各带 8 bit 校验) | 两个子通道可独立并发,布线需两两对称 |
| 突发长度 | BL8 / BC4 | BL16 / BC8 | 一次访问 64 B(单子通道 32 B),缓存行利用率提高 |
| 预取 | 8n | 16n | 控制器调度粒度变化,tCCD 等参数随之改变 |
| Bank 结构 | 4 BG × 4 = 16 bank | 8 BG × 4 = 32 bank | 并发度翻倍,tFAW / tRRD 约束需重新核算 |
| 命令地址 | ADDR + RAS#/CAS#/WE#/ACT# | CA[13:0] 14 bit 串行总线 | 命令引脚减少约 20 个,但 CA 需 1T/2T 训练 |
| 片内 ECC | 无(部分厂商私有) | 有(on-die ECC,透明,不占引脚) | 阵列可靠性提升,但不等于系统级 SECDED |
| 系统级 ECC | x72 模组(64+8) | 每子通道 32+8,双通道共 80 bit 链路 | 「同帧 ECC」:校验与数据同帧传输,不扩展外部数据宽度 |
| 均衡 | CTLE(控制器侧)、无 DFE | 控制器 CTLE/DFE + DRAM 侧 DFE | 训练项增加,上电训练时间显著变长 |
| ODT | RTT_NOM / RTT_WR / RTT_PARK | RTT_NOM_RD / RTT_NOM_WR / RTT_WR / RTT_PARK | 读写端接可分别设置,写眼图调试空间更大 |
| ZQ 校准电阻 | 240 Ω ±1% | 240 Ω ±1%(低寄生布局) | 必须靠近 ZQ 引脚,走线 ≤ 5 mm,禁止过孔 |
| 刷新 | All-Bank Refresh | All-Bank + Same-Bank(REFsb) | 刷新可只针对部分 bank,降低性能抖动 |
| 告警 / 训练引脚 | ALERT_n(部分)、PARITY | ALERT_n、TEN、Loopback 反馈 | 管理侧需增加上拉与测试点 |
| 模组管理 | SPD EEPROM(I2C) | SPD Hub + PMIC + TS(I2C/I3C) | 需 3.3 V 管理电源与上拉,支持遥测与热节流 |
最容易踩的坑:把 DDR5 当「更快的 DDR4」来画
DDR5 不是 DDR4 的提速版。若沿用 DDR4 的电源树(主板直供 1.1 V 给插槽)、沿用 DDR4 的 1.6 GHz 走线规则、或用 DDR4 的等长公差(±25 mil 组间),在 6400 MT/s 上大概率表现为训练失败、只能降速到 3600/4000、或高温环境随机 ECC 报错。电源架构、叠层板材、等长公差、训练项四类必须同步升级。
1.2 封装与球位定义
| DDR5 颗粒 x8 | FBGA-82 | 9.0 × 11.0 mm(典型) | 0.8 mm / 82 ball | 板载(down)方案主流;单颗 x8,需 4 颗组 32 bit 子通道 |
| DDR5 颗粒 x16 | FBGA-102 | 9.0 × 14.0 mm(典型) | 0.8 mm / 102 ball | 2 颗组 32 bit;球数少、布局友好,但可选型号少 |
| DDR5 颗粒 x4 | FBGA-82 / 96 | 9.0 × 11.0 mm(典型) | 0.8 mm | 多见于服务器高密度 RDIMM(8 颗组 32 bit) |
| UDIMM / RDIMM | 288 pin 金手指 | 133.35 × 31.25 mm | 0.85 mm pin pitch | 双面子通道分区,中部卡口防呆 |
| SODIMM | 262 pin 金手指 | 69.6 × 30.0 mm | 0.5 mm pin pitch | 笔记本 / 边缘设备,同样双 40 bit 子通道 |
| CAMM2 / LPCAMM2 | 压缩连接器(LGA 式) | 约 78 × 30 mm | 0.85 mm 网格 | 更低高度、更短走线,可跑更高速率;需专用连接器 |
DDR5 封装与 288 pin 模组信号分区(示意)① DDR5 颗粒 FBGA-82(x8,0.8 mm 球距)A19.0 mm(列方向)球位分区图例DQ[7:0] / DQS_t·DQS_c / DM_n(数据组,8 位 + 1 对选通 + 1 掩码)CA[13:0] / CS_n / CK_t·CK_c(命令地址与时钟,串行化命令)VDD / VDDQ 1.1 V(主电源与 I/O 电源,数量最多)VSS / VSSQ(地,与电源球 1:1 交错布置降低回路电感)VPP 1.8 V / ZQ / ALERT_n / RESET_n / TEN / Loopback / NC② 288 pin UDIMM / RDIMM 金手指分区(正反面合计)卡口 Notch(防呆)VDD / VDDQ / VSS(1.1 V 主电源与地)≈ 120 pinVPP 1.8 V(由 On-DIMM PMIC 产生,板上不再直供)≈ 12 pinCK_A_t / CK_A_c(子通道 A 差分时钟)2 pinCA_A[13:0] + CS_A_n(子通道 A 命令地址总线)15 pinDQ_A[31:0] + DQS_A_t/c ×4 + DM_A_n ×4(数据组)52 pinCB_A[7:0](子通道 A 校验位,与 32 bit 数据同帧)8 pinCK_B / CA_B[13:0] / CS_B_n(子通道 B 命令时钟,完全独立)17 pinDQ_B[31:0] + DQS_B_t/c ×4 + DM_B_n ×4(数据组)52 pinCB_B[7:0](子通道 B 校验位)8 pinALERT_n / RESET_n / TEN / Loopback(开漏需上拉)≈ 6 pinHSCL / HSDA(I2C/I3C 管理总线 → SPD Hub + PMIC + TS)2 pinSA0~SA2 / 保留 / 机械检测(地址选择与在位检测)≈ 6 pin▶ UDIMM / SODIMM:主控直连颗粒(仅地址时钟走 Fly-by);▶ RDIMM:CK / CA / CS 经 RCD 寄存再驱动;LRDIMM 另加 DB 缓冲 DQ。▶ 两个子通道各自独立训练,主控必须分别完成 write/read leveling 与 VREF。注:pin 数与分组为示意,确切分布以 JEDEC 模组规范与目标型号 datasheet 为准。
图 1-1 DDR5 颗粒 FBGA-82 球位分区(含 A1 标记)与 288 pin 模组信号分区:两个子通道各 40 bit(32 DQ + 8 CB),命令与时钟完全独立
1.3 关键电气参数
| 核心 / I/O 电压 | VDD / VDDQ | 1.1 V(AC 噪声 ±3% 量级) | 含 DC 误差 + 纹波 + 噪声的总容差按目标型号;1.1 V 下 33 mV 是全部预算 |
| 字线升压 | VPP | 1.8 V(±5% 量级) | 电流很小(mA 级),但对噪声敏感,需独立去耦与短走线 |
| I/O 电平标准 | — | PODL(端接到 VDDQ) | 与 DDR4 的 POD12 同为伪开漏,高电平由端接上拉建立 |
| 输入参考电压 | VREF | 内部生成,多档 MR 可调 | DDR5 内部 VREF 训练范围更宽,需按训练结果锁定 |
| 差分时钟频率 | fCK | 1.6 ~ 4.4 GHz | 等于数据速率的一半;抖动(RMS)要求随速率收紧 |
| CA 总线速率 | — | SDR @ fCK(1T / 2T 命令) | 命令在 1 或 2 个 CK 周期内串行发完 |
| 单端阻抗(DQ / CA / DM) | Z0 | 40 Ω ±10% | 部分平台为 40 Ω;以主控 PDG 为准,不可沿用 DDR3 的 50 Ω |
| 差分阻抗(CK / DQS) | Zdiff | 80 Ω ±10% | 差分对内等长 ±1~2 mil,禁止跨分割 |
| ZQ 校准电阻 | RZQ | 240 Ω ±1%(低寄生) | 贴装距 ZQ 引脚 ≤ 5 mm,走线不加过孔,包地处理 |
| 片内端接 | RTT | 240 / 120 / 80 / 60 / 48 / 40 / 34 Ω 等 | DDR5 将 Nominal 拆为 RD / WR 两类,见第 7 章 |
| 刷新间隔 | tREFI | 3.9 µs(≤85 °C) | DDR4 为 7.8 µs;>85 °C 时典型折半为 1.95 µs |
| 刷新命令周期 | tRFC1 / tRFC2 / tRFCsb | 约 295 / 160 / 130 ns(16 Gb 量级) | 随密度显著变化;REFsb 只刷新单 bank,延迟最短 |
| 工作温度(颗粒) | Tcase | 0 ~ 85 °C(商业);-40 ~ 95 °C(工温/车规) | >85 °C 触发 2× 刷新率与热节流,带宽下降 |
| 存储温度 | Tstg | -55 ~ 100 °C | 运输与仓储需控制湿度(MSL 管控) |
| ALERT_n 上拉 | — | 典型 4.7 ~ 10 kΩ 到 1.1 V 或管理电源 | 开漏输出,多器件线与;上拉电源域以 datasheet 为准 |
| RESET_n | — | 低有效,上电期间需保持低 ≥ 规定时间 | 板载方案建议 1~10 kΩ 下拉 + 主控 GPIO 可控上拉 |
| ESD 等级 | HBM / CDM | HBM ≥ 1000 V;CDM ≥ 250 V(典型) | 高速引脚 ESD 器件结电容需 ≤ 0.3 pF 级或干脆不加 |
上表中的阻抗、端接与时序值会随代际与厂商修订而变;主控提供的 PDG(Processor Design Guide / DDR Design Guide)优先级高于本文,冲突时以 PDG 为准。
2 · 接口与协议
DDR5 最大的协议变化是「命令地址串行化」:传统 RAS#/CAS#/WE#/ACT# 引脚被取消,所有命令由 14 bit CA 总线在 1~2 个 CK 周期内串行发送。这一改动把引脚数降下来的同时,把时序约束与训练责任转移到了控制器与 Layout。
2.1 完整信号定义
| CK_t / CK_c | 主控→DRAM | 差分,80 Ω | 1 对 | 命令与地址的时序基准;频率 = 速率/2。差分对内等长 ±1~2 mil,禁止在途中分叉 |
| CA[13:0] | 主控→DRAM | 单端 40 Ω,SDR | 14 | 命令 + 地址 + Bank/BG 复用总线;部分命令需 2 个 CK(2T)。组内等长,Fly-by 末端端接 |
| CS_n | 主控→DRAM | 单端 40 Ω | 1(3DS 为 CS_n_A / CS_n_B) | 片选兼命令有效性指示;多 rank 时每个 rank 一根,随 Fly-by 顺序排列 |
| DQ[7:0](x8) | 双向 | PODL 单端 40 Ω | 8 | 数据位;4 颗 x8 组 32 bit 子通道。组内与 DQS 等长 ±3~5 mil |
| DQS_t / DQS_c | 双向 | 差分 80 Ω | 1 对 / 字节组 | 数据选通;读写双向,读时由 DRAM 发出(与 DQ 边沿对齐→主控做 read leveling) |
| DM_n(x8/x16) | 主控→DRAM | 单端 40 Ω | 1 / 字节组 | 写数据掩码;x16 可能为 DM_n/DBI_n 复用。与同组 DQ 等长 |
| CB[7:0](模组) | 双向 | PODL 单端 40 Ω | 8 / 子通道 | 校验位(check bits),与 32 bit 数据同帧传输,供主控做 SECDED。板载方案若主控不用则按 NC/接地处理(依 datasheet) |
| ALERT_n | DRAM→主控 | 开漏输出,需上拉 | 1 | CRC 错误、命令/地址奇偶错误、温度事件共用的告警线。低有效,多器件线与 |
| RESET_n | 主控→DRAM | 单端,低有效 | 1 | 上电与异常恢复复位;需在 VDD 稳定后保持低电平足够时间再释放 |
| TEN | 主控→DRAM | 单端,高有效 | 1 | 测试 / 连通性测试模式使能(Test Enable)。正常运行时保持无效电平,建议预留下拉 |
| Loopback(反馈输出) | DRAM→主控 | 单端 / 专用反馈 | 1~2(依型号) | 训练反馈通道,把 DRAM 内部采样到的时钟/数据相位回传主控,用于 Loopback 训练与 DFE 收敛 |
| ZQ | 外接电阻 | 模拟 | 1 | 外接 240 Ω ±1% 精密电阻,作为 ODT 与驱动强度校准基准 |
| VDD / VDDQ | 电源 | 1.1 V | 多球 | 核心与 I/O 电源,通常同电位、同层铜皮,分别去耦 |
| VPP | 电源 | 1.8 V | 1~2 球 | 字线升压;电流小但对噪声敏感,靠近颗粒放置 0.1 µF |
| VSS / VSSQ | 地 | 0 V | 多球 | 与电源球交错,保证每个数据球旁有回流地孔 |
| HSCL / HSDA(模组) | 双向 | 开漏,I2C / I3C | 2 | 管理总线,挂 SPD Hub、PMIC(及温度传感器)。需外部上拉,速率 100 kHz ~ 12.5 Mbps(I3C SDR/HDR) |
信号层面的两个易错点
① ALERT_n 是开漏,板上必须有上拉;若多 rank 共用一根 ALERT_n,需确认主控能区分是哪一个 rank 触发(通常靠逐个 rank 查询 MR 状态位)。② TEN 与 Loopback 引脚名在不同厂商间命名不完全一致(部分厂商写作 TEN / LBDQ / LB_DQS 等),原理设计时务必按目标 datasheet 校对,不要照抄参考设计的网络名。
2.2 CA 总线:命令如何被「串行化」
DDR5 的命令由 CA 总线在 1 个(1T)或 2 个(2T)CK 周期内传输。第一个周期传输命令码与部分地址,第二个周期(若需要)传输剩余地址与 Bank/Bank Group 位。主控侧通过 CA 训练(CA Training)确定采样点,DRAM 侧通过内部 VREF 与(部分器件的)CA 端接保证信号质量。
| ACTIVATE(ACT) | 2T | 命令码 + Row 地址 + BG/Bank | 打开一行;DDR5 32 bank 需要更多 Bank 位 |
| READ / WRITE | 1T 或 2T | 命令码 + Column 地址 + BG/Bank + AP(自动预充电) | BL16 时列地址按 16 突发对齐 |
| PRECHARGE(PRE) | 1T / 2T | 命令码 + Bank 或 All-Bank 标志 | 关闭行,为下次 ACT 做准备 |
| REFRESH(REFab) | 1T | 命令码 | All-Bank Refresh,需满足 tRFC1 |
| REFRESH(REFsb) | 1T | 命令码 + Bank 地址 | Same-Bank Refresh,仅刷新指定 bank,其余 bank 可继续工作 |
| MODE REGISTER WRITE/READ(MRW/MRR) | 2T | 命令码 + MR 地址 + 数据 | 训练期间高频使用;写 MR 后需等待 tMRD / tMOD |
| ZQ CALIBRATION | 1T | 命令码 + Long/Short 标志 | 上电需 ZQCL(长校准),退出自刷新后常用 ZQCS |
| MPC(Multi-Purpose Command) | 2T | 命令码 + 操作码 | 承载训练模式进入/退出、DFE 使能、VREF 设置、Loopback 使能等 |
| RFM(Refresh Management) | 1T | 命令码 + Bank | 行锤缓解:对高频激活区域发起额外刷新 |
| NOP / DESELECT | 1T | — | CK 边沿采样到 CS_n 无效或空操作码 |
CA 总线的硬件含义
- 引脚数下降:取消 RAS#/CAS#/WE#/ACT#/BA/ADDR 分立引脚后,x8 颗粒的地址命令类引脚从 DDR4 的约 25 根降到 15 根,为电源与地腾出球位(这也是 DDR5 能在 1.1 V 下保持电源完整性的前提之一)。
- 时序余量下降:CA 是 SDR 但速率等于 fCK(最高 4.4 GHz 命令率),建立保持窗口极小,必须做 CA 训练(VREF + 延迟),且 CA 走线必须 Fly-by 等长、末端端接。
- 2T 命令降低效率:高频下主控常自动切到 2T 命令时序(类似 DDR 的 2T 模式),会损失少量带宽,属正常现象,不要误判为故障。
- 调试难度上升:逻辑分析仪无法像 DDR3 那样「看引脚知命令」,必须使用支持 DDR5 CA 解码的协议分析仪或依赖主控训练日志。
2.3 BL16 / BC8、子通道与同帧 ECC
突发长度 BL16 与 Burst Chop BC8
| 标准突发长度 | BL16 | 单次读/写传输 16 个数据节拍,在 DQ 上占用 8 个 CK 周期(DDR 双沿) |
| Burst Chop | BC8 | 半突发,传输 8 个节拍,用于不满 32 B 的访问,减少无用数据搬移 |
| 子通道单次传输量 | 32 bit × 16 = 64 B | BL16 下单个子通道一次突发 = 64 B;两个子通道并发 = 128 B |
| 与缓存行的对齐 | 64 B 缓存行 = 单子通道 1 次 BL16 | 这是 DDR5 选择 BL16 的核心原因:与主流 CPU 64 B 缓存行天然对齐 |
| 预取 | 16n | 阵列一次读出 16n,对外以 BL16 吐出 |
同帧 ECC(Same-Frame ECC)与片上 ECC 的区别
| On-die ECC(片上 ECC) | DRAM 颗粒内部 | 内部校验,不占用任何外部引脚 | 完全透明,主控无感知 | 提升阵列良率与保持特性,但不能替代系统级 ECC:无法检测 DQ 链路上的传输错误 |
| 同帧 ECC(Link / Same-Frame ECC) | 主控 ↔ DRAM 链路 | 每 32 bit 数据配 8 bit 校验(CB[7:0]) | 主控可见,需 SECDED 引擎 | 校验位与数据在同一帧内传输,不额外增加传输周期;代价是每子通道多 8 根线 |
| 传统 ECC(DDR4 x72) | 模组级 | 64 bit 数据 + 8 bit ECC | 主控可见 | 需要把总线扩展到 72 bit,所有 DQ 走线与颗粒数量增加 1/8 |
为什么 DDR5 说「不扩展数据宽度」
DDR5 的 40 bit 子通道中,32 bit 是数据、8 bit 是校验。相比 DDR4 的 72 bit(64 数据 + 8 校验)方案,DDR5 的校验位比例是 DDR4 的两倍(32:8 而非 64:8),因此可以实现更强的纠错(部分主控可做到 SECDED 之外再检测部分多比特错误)。所谓「不扩展数据宽度」指的是:校验位不作为独立的一颗 x8 颗粒挂在总线上扩展总线位宽,而是与数据同帧、同子通道、同突发传输,颗粒位宽仍是 x8/x16,总线调度不因 ECC 而变复杂。若主控不使用 ECC,CB 位并非简单悬空——需按主控与器件 datasheet 处理(常见做法为接地或保持端接),切勿凭经验悬空。
2.4 刷新机制与 Same-Bank Refresh
| All-Bank Refresh(REFab) | 整个器件全部 bank | tRFC1(≈295 ns @16 Gb) | 期间所有 bank 不可访问,延迟尖峰明显 | 上电初始化、空闲窗口、或无法做细粒度调度时使用 |
| Same-Bank Refresh(REFsb) | 单个 bank | tRFCsb(≈130 ns @16 Gb) | 仅目标 bank 阻塞,其余 31 个 bank 可继续服务 | 业务态首选;主控需支持 REFsb 调度才能受益 |
| Fine Granularity Refresh | 可配置比例 | 按 MR 设置 | 把刷新开销摊薄 | 高温场景优先启用 |
| RFM / ARFM(行锤缓解刷新) | Bank 或 Bank Group | 按激活计数触发 | 少量额外刷新开销 | 必须启用;由主控或 DRAM 内部计数触发 |
刷新开销估算(单 rank,2 个 16 Gb x8 颗粒组 32 bit 子通道):
标准刷新:tREFI = 3.9 us -> 1 s 内 256,000 次 REFab
每次 tRFC1 ≈ 295 ns -> 占用率 = 256000 x 295ns / 1s ≈ 7.5%
同帧拆分为 REFsb(假设把 32 bank 分为 32 次,每次 tRFCsb ≈ 130 ns):
总刷新次数不变,但单次阻塞从 295 ns 降到 130 ns
最坏情况单次阻塞降低约 56%,延迟尖峰明显改善
高温(> 85 C):tREFI 折半为 1.95 us -> 占用率约 15%,带宽可观测下降
=> 热设计目标:Tcase 控制在 85 C 以下,避免进入 2x 刷新区
2.5 模式寄存器与训练相关 MR
DDR5 的模式寄存器数量显著多于 DDR4,训练相关的设置项分散在多个 MR 中。下表列出与硬件设计/调试最相关的项(地址与位定义以 JESD79-5 与目标 datasheet 为准):
| MR0~MR5(基础) | BL、CL、WR/RTP、驱动强度、ODT 相关基础项 | 初始化第一批发写;写错会直接导致训练失败 |
| MR(写均衡) | Write Leveling 使能 / 输出使能 | 需要 DQS 与 CK 走线可测;训练失败时优先排查 DQS/CK 拓扑 |
| MR(Read Leveling) | Read Leveling / DQS 延迟链设置 | 与 DQ-DQS 组内等长强相关 |
| MR(VREF) | 内部 VREF 档位、VREF 训练范围与步进 | VREF 不合理会表现为高温/低压下随机错 |
| MR(DFE) | DFE 使能、抽头数量、系数加载 | DFE 不收敛时优先查通道插损与残桩 |
| MR(DCA) | Duty Cycle Adjuster 占空比调整 | CK 占空比失真 > 2% 时补偿 |
| MR(CA 训练) | CA 训练模式进入/退出、CA VREF、CA ODT | CA 走线 Fly-by 末端端接不良时训练不通过 |
| MR(CS 训练) | CS_n 训练模式 | 多 rank 时逐 rank 单独训练 |
| MR(Loopback) | Loopback 反馈输出使能与选择 | 需要 PCB 上 Loopback 网络连通且不被误接上拉/下拉 |
| MR(RTT) | RTT_NOM_RD / RTT_NOM_WR / RTT_WR / RTT_PARK | 端接值选择见第 7 章 |
| MR(刷新) | REFsb 使能、FGR 比例、RFM/ARFM 配置 | 行锤与高温可靠性相关 |
| MR(温度) | 温度读出、热节流阈值、ALERT_n 温度事件使能 | 与 SPD Hub 内 TS 读数交叉核对 |
| MR(ECC / CRC) | ECC 使能、写 CRC、错误状态与计数读出 | ECC 报错排查的核心入口 |
典型初始化写 MR 序列(示意,顺序与延时以主控 MRC 与 datasheet 为准)
1. 供电稳定(VDD/VDDQ 1.1 V、VPP 1.8 V),拉低 RESET_n
2. RESET_n 保持低 >= tPW_RESET(典型 1 us 量级,以 datasheet 为准)
3. 释放 RESET_n,等待 tXPR(典型几百 ns ~ us)
4. 拉高 CKE 类使能(DDR5 由命令/CS 管理,按主控要求执行)
5. ZQCL(长校准),等待 tZQINIT(典型 1 us 量级)
6. MRW:设置 BL=16、CL、tWR、驱动强度、RTT_PARK
7. MRW:进入 Write Leveling 模式 -> 训练 -> 退出
8. MRW:CA 训练模式 -> CA VREF / CA 延迟训练 -> 退出
9. MRW:Read Leveling / DQS 延迟训练
10. MRW:内部 VREF 训练(逐字节、逐子通道)
11. MRW:DFE 使能 + 系数训练
12. MRW:DCA(占空比)训练
13. MRW:Loopback 训练(若主控与颗粒支持)
14. MRW:正常模式,进入 IDLE,开始正常读写
15. 周期性:ZQCS(短校准)、VREF 重训练、温度触发重训练
2.6 带宽与容量计算
| DDR5-3200 | 0.625 | 12.8 | 25.6 | 22-22-22 | 13.75 |
| DDR5-3600 | 0.556 | 14.4 | 28.8 | 26-26-26 | 14.44 |
| DDR5-4000 | 0.500 | 16.0 | 32.0 | 30-30-30 | 15.00 |
| DDR5-4400 | 0.455 | 17.6 | 35.2 | 34-34-34 | 15.45 |
| DDR5-4800 | 0.417 | 19.2 | 38.4 | 40-40-40 | 16.67 |
| DDR5-5200 | 0.385 | 20.8 | 41.6 | 42-42-42 | 16.15 |
| DDR5-5600 | 0.357 | 22.4 | 44.8 | 46-45-45 | 16.43 |
| DDR5-6000 | 0.333 | 24.0 | 48.0 | 48-48-48 | 16.00 |
| DDR5-6400 | 0.313 | 25.6 | 51.2 | 52-52-52 | 16.25 |
| DDR5-7200 | 0.278 | 28.8 | 57.6 | 58-58-58 | 16.11 |
| DDR5-8000 | 0.250 | 32.0 | 64.0 | 64-64-64 | 16.00 |
| DDR5-8800 | 0.227 | 35.2 | 70.4 | 70-70-70 | 15.91 |
带宽计算公式(理论峰值)
单子通道峰值 (B/s) = 速率(MT/s) x 子通道位宽(bit) / 8
例:DDR5-6400 单子通道 = 6400 x 32 / 8 = 25,600 MB/s = 25.6 GB/s
单个 DIMM 峰值 = 速率 x 64 / 8 (双 32 bit 子通道合计)
例:DDR5-6400 DIMM = 6400 x 64 / 8 = 51.2 GB/s
注意:若启用 ECC(CB[7:0]),链路总位宽为 (32+8) x 2 = 80 bit,
但「数据带宽」仍按 64 bit 计算,校验位不承载用户数据。
有效带宽 = 峰值 x 效率系数
效率系数典型:Stream 类连续流 0.85~0.92
随机小粒度访问 0.25~0.45
受 tRC / tREFI / 刷新占用率 / 读写翻转惩罚影响
板载(down)方案容量计算:
单子通道容量 = 颗粒容量(bit) x 颗粒数 / 8
例:4 颗 x8 16 Gb -> 16 Gb x 4 / 8 = 8 GB(单子通道)
两子通道共 8 颗 -> 16 GB
2.7 多 Rank、3DS 与容量组织
| Rank | 共享同一组 CA/CS 的一组颗粒,一次访问只选通一个 rank | DQ 总线负载增加(多 rank 时 DQ 为多点分支) | 每 rank 需独立 CS_n;Fly-by 顺序必须与主控期望一致 |
| 3DS(3D Stacked) | 单封装内堆叠 2~8 个 die,通过 CS_n_A / CS_n_B 与内部 CID 选择 | 负载与单点分支类似多 rank,但走线更短 | 需确认主控支持 3DS;上电训练项增加 |
| 颗粒位宽组合 | x4 / x8 / x16 | x4 需要 8 颗组 32 bit,负载最重但密度最高 | 板载方案优先 x16(2 颗/子通道,走线最短) |
| 最大容量 | 单 DIMM 可达 128 GB+(RDIMM / 3DS / TSV 组合) | 容量越大,刷新与地址位越多 | 地址位增加会提高 CA 2T 命令占比 |
2.8 模组上的关键器件:RCD / DB / PMIC / SPD Hub
| RCD | Registering Clock Driver | RDIMM(必选) | 对 CK、CA、CS 进行寄存与再驱动,隔离颗粒负载;支持 CA 端接与内部均衡 | 由 PMIC 供电;主控侧必须按 RCD 的寄存器做训练(RCD 引入固定延迟,需补偿) |
| DB | Data Buffer | LRDIMM(必选) | 对 DQ / DQS / DM 缓冲,把颗粒侧数据负载隔离 | DDR5 LRDIMM 常用 MRCD/MDB(多路复用型);会增加约数 ns 往返延迟 |
| PMIC | Power Management IC | 所有 DDR5 模组 | 输入 5 V 或 12 V,输出 VDD / VDDQ / VPP 三路;SMBus/I3C 可配置与遥测(电压、电流、温度、故障) | UDIMM/SODIMM 通常 1 颗;RDIMM 常见 2 颗(分别供两个子通道区域)。输出电压与时序由模组厂商预设,也可由主控改写 |
| SPD Hub | Serial Presence Detect Hub | 所有 DDR5 模组 | 存储 SPD 数据,并作为 I3C/I2C hub 管理 TS(温度传感器)与其他从设备 | 内含 TS(典型 1~2 个温度传感点);主控通过它读取温度并触发热节流 |
| TS | Temperature Sensor | 集成于 SPD Hub 或分立 | 提供 DIMM 温度,用于刷新率切换与节流 | 读数与 DRAM 内部 MR 温度寄存器应交叉核对 |
管理总线(HSCL / HSDA)的硬件要求
| 协议 | I2C 兼容 + I3C(MIPI I3C Basic) | 上电阶段以 I2C 模式通信,主控可切换到 I3C 提升遥测速率 |
| 速率 | 100 kHz / 400 kHz / 1 MHz(I2C);最高 12.5 Mbps(I3C SDR) | 高速模式需重新核算上拉与总线电容 |
| 上拉电阻 | 典型 1.5 ~ 4.7 kΩ(依电压与总线电容) | 上拉到管理电源(模组侧常为 3.3 V 或 1.8 V,以规范为准);主控侧需匹配电平 |
| 总线电容 | ≤ 100 pF(I2C 400 kHz 常规上限) | 多插槽并联会累加,需核算或加总线缓冲 |
| 地址 | SPD Hub 与 PMIC 各有独立地址,由 SA0~SA2 类引脚设定 | 多插槽时必须保证地址不冲突;原理设计预留地址配置电阻 |
| PCB | 走成对、远离高速信号、包地 | 虽是低速总线,但被干扰会导致 SPD 读取失败、整机点不亮 |
管理总线是最容易被忽略的「点不亮」根因
若 HSCL/HSDA 上拉缺失、上拉电源域错误、或多插槽地址冲突,表现为主控读不到 SPD → 无法确定内存参数 → 直接拒绝初始化,且不会给出有意义的高速报错。原理设计阶段必须:① 确认上拉电源域;② 为 SA0~SA2 留 0 Ω 可选配置;③ 在管理总线上预留测试点(但不要加拉低总线电容的测试焊盘)。
3 · 电源设计
DDR5 电源设计的第一原则是:电压调节从主板下沉到内存条。模组方案主板只负责送 5 V 或 12 V;板载(down)方案则必须由设计者自己完成整条 PMIC / DC-DC 链路。1.1 V 下 ±3% 的 AC 噪声预算(约 33 mV)决定了这一章的每一项都不能打折。
3.1 电源域与容差
| VDD(核心) | 1.1 V | On-DIMM PMIC | 自建 PMIC / 单相或多相 buck | DC 精度 + 纹波 + 瞬态总和需满足 datasheet(典型 ±3% AC) |
| VDDQ(I/O) | 1.1 V | On-DIMM PMIC(常与 VDD 同路或独立路) | 可与 VDD 共用,也可通过磁珠/电感隔离 | 高频噪声直接叠加在 DQ 上,去耦必须到颗粒 |
| VPP(字线升压) | 1.8 V | On-DIMM PMIC 第三路 | 小电流 LDO 或 buck(几十 mA 量级) | 电流小但需独立去耦,避免与 VDD 共用同一滤波节点 |
| 管理电源(模组侧) | 1.8 V / 3.3 V(依规范) | 主板常供 VIN_SPD 类电源 | 按颗器件确定 | 给 SPD Hub / PMIC 控制逻辑供电,掉电时通常需保持或受控 |
| ZQ / VREF | — | 内部生成 | 内部生成 | ZQ 外接 240 Ω ±1%,温度系数 ≤ 100 ppm/°C 更好 |
噪声预算拆解(以 VDD = 1.1 V 为例,数值按目标 datasheet 复核)
总容差(典型) : ±3% -> ±33 mV
其中建议分配:
DC 设定误差 : ≤ 8 mV (PMIC 反馈电阻 0.5% + 基准源误差)
低频纹波 (<1MHz): ≤ 10 mV (由 buck 输出电感/输出电容决定)
高频噪声 (>1MHz): ≤ 8 mV (由陶瓷去耦阵列与平面电容决定)
瞬态跌落 : ≤ 7 mV (由负载阶跃响应与 bulk 电容决定)
=> 只要有一项超预算,就会在眼图上直接表现为:写眼收窄、VREF 训练窗口变窄、
高温下随机错。不要指望「靠训练救回来」——训练能补偿时序,补偿不了电源噪声。
3.2 On-DIMM PMIC
| 输入电压 | 5 V(SODIMM / 多数 UDIMM)或 12 V(服务器 RDIMM) | 由模组形态决定;主板只送一种,原理设计前先确认插槽定义 |
| 输出通道 | 3 路:VDD / VDDQ / VPP | 部分 PMIC 集成第四路(管理电源)或 LDO |
| 输出电流能力 | VDD+VDDQ 合计可达数十 A 量级(依 PMIC 与模组) | 主板 5 V/12 V 电源必须按满配模组数量留余量(见 3.3) |
| 控制接口 | I2C / I3C(SMBus 兼容) | 与 SPD Hub 挂在同一条 HSCL/HSDA 上,地址不同 |
| 遥测 | 输出电压、电流、温度、故障状态 | BMC / BIOS 读取用于热节流与故障上报 |
| 可配置性 | 输出电压、软启动、保护阈值、开关频率 | 默认值由模组厂商写入;主控可改写(部分平台锁定) |
| 故障行为 | OVP / UVP / OCP / OTP → 关断或告警 | ALERT_n 与 PMIC 状态寄存器是排查电源问题的第一入口 |
| 数量 | UDIMM / SODIMM 通常 1 颗;RDIMM / LRDIMM 常见 2 颗 | 两颗时地址需区分,遥测要分别读取 |
3.3 板载(down)方案与主板供电规划
板载 vs 插槽的取舍
| 信号质量 | 走线最短(可 ≤ 3 inch),无连接器损耗,最容易跑到 6400+ 优 | 插槽引入 1~2 dB 插损与阻抗不连续,速率上限受限 |
| 容量灵活性 | 出厂即固定 劣 | 现场可更换、可扩容 优 |
| 电源责任 | 设计者全责:PMIC 选型、时序、去耦、PDN | 由模组 PMIC 承担,主板只需送 5 V/12 V |
| 成本与库存 | BOM 低,但颗粒需按项目备货 | BOM 高(含 PMIC/SPD/RCD),但模组通用 |
| 维修性 | BGA 返修困难 | 换条即可 |
| 适用场景 | 嵌入式、边缘计算、空间受限、固定配置 | 服务器、PC、工控、需现场扩容的场景 |
板载方案电源预算估算(示例,数值需按实际器件复核)
单颗 DDR5 x8 颗粒工作电流(估算量级):
IDD0(激活待机) ~ 40~70 mA
IDD4R(读,6400 MT/s) ~ 150~250 mA
IDD4W(写,6400 MT/s) ~ 180~300 mA
IDD5B(刷新) ~ 200~350 mA
IDD2P(低功耗) ~ 15~40 mA
8 颗粒(16 GB,双 32 bit 子通道)满负荷估算:
I_VDD ≈ 8 x 0.25 A = 2.0 A(读写峰值可到 3 A)
I_VDDQ ≈ 0.5~1.5 A(与 DQ 翻转率和端接电流相关,端接电流不可忽略)
I_VPP ≈ 10~30 mA(很小,但需独立路)
输入侧(12 V)电流:
总功率 ≈ 1.1 V x 3.5 A + 1.1 V x 1.5 A + 1.8 V x 0.03 A ≈ 5.6 W
I(12V) ≈ 5.6 W / 12 V / 0.9(效率) ≈ 0.52 A
多插槽场景(服务器,8 条 RDIMM @ 12 V):
单条峰值按 25~40 W 计 -> 8 条 ≈ 200~320 W
=> 12 V 输入需 ≥ 30 A,必须独立电源层 + 多盎司铜厚
多插槽主板的 5 V / 12 V 分配
模组方案下,主板的 5 V/12 V 是唯一的供电通道,其纹波会被 PMIC 的 PSRR 部分抑制,但低频跌落无法抑制。设计时必须:① 按满配最高速率模组计算输入电流并留 ≥ 20% 余量;② 电源层铜厚 ≥ 2 oz(服务器建议内层电源用 2 oz 或加铺);③ 每条插槽附近布置 bulk 电容(见 3.4);④ 避免与 GPU / 电机 / 大电流 DC-DC 共用同一路。
3.4 去耦电容配置
| 颗粒 VDD 球附近(背面) | 0.1 µF × 1~2 + 0.01 µF × 1(每颗) | 0201 / 0402 | 10~100 MHz | 必须背面贴装、过孔最短;0.01 µF 优先选低 ESL 型 |
| 颗粒 VDDQ 球附近 | 0.1 µF × 1 + 0.047 µF × 1(每颗) | 0201 / 0402 | 10~150 MHz | I/O 电源噪声直接进 DQ 眼图,优先级最高 |
| 颗粒 VPP | 0.1 µF × 1(每颗) | 0402 | — | 靠近 VPP 球,回流路径短 |
| 子通道区域中频 | 1 µF / 2.2 µF × 每 2 颗 1 只 | 0603 / 0805 | 1~10 MHz | 均匀铺开,不要集中在一处 |
| Bulk(每个子通道区) | 10 µF / 22 µF × 2~4 | 0805 / 1206 | 100 kHz~1 MHz | 陶瓷优先;低 ESL 阵列电容更佳 |
| VRM 输出(板载方案) | 100~330 µF(陶瓷 + 聚合物并联) | 1210 / 钽 / 聚合物 | < 100 kHz | 聚合物电容提供 ESR 阻尼,抑制反谐振峰 |
| 插槽附近(每条 DIMM) | 10 µF × 2~4 + 1 µF × 4~6(输入 5 V/12 V) | 0805 / 1206 | 输入侧保持 | 输入电容不足会在负载跳变时拉垮输入轨 |
去耦布局硬规则
1. 高频电容(0.1 / 0.01 uF)必须贴在颗粒背面、正对电源球,
过孔到焊盘距离 <= 1.0 mm,过孔到平面 <= 0.5 mm。
2. 每个电容至少 2 个过孔到电源平面、2 个过孔到地平面,禁止共用过孔。
3. 电容本体到 BGA 的距离优先于「布线美观」:宁可绕线,不要挪走电容。
4. 不同容值电容不要排成一条直线(会造成同一方向的反谐振),
采用交错 / 棋盘式布置。
5. 0201 与 0402 混用时注意回流焊的立碑风险,0402 更稳妥。
6. 板载方案在 VRM 输出侧预留 1~2 个 bulk 焊位,便于调试时调整 ESR/容值。
3.5 上电 / 掉电时序
DDR5 上电 / 复位 / 初始化时序(示意,时间轴非等比)t0 使能t1 管理电源 OKt2 VDD 达 90%t3 RESET_n 释放t4 ZQCL 完成t5 训练阶段t6 正常读写管理/备用电源1.8 V / 3.3 V(管理域,先行建立)VDD / VDDQ1.1 V单调上升,禁止回勾≥ 200 us 稳定期(典型,以 datasheet 为准)VPP1.8 VVPP 与 VDD 同时或先于 VDD 建立,任意时刻 VPP ≥ VDDRESET_n(低有效)整段供电爬升期间保持低电平释放后需等待 ≥ 规定时间(tXPR 量级)才允许发第一条命令(见下)ZQCLCA / WL / RL 训练VREF / DFE / DCA此区间:控制器、PLL、PHY 上电,命令总线保持无效态
图 3-1 DDR5 上电与复位时序:管理电源先行、VDD/VDDQ 单调上升、VPP 同步或提前、RESET_n 全程拉低并在电源稳定后释放
上电时序规则(整理版,所有延时以目标 datasheet 为准)
seq:
1) 管理/备用电源建立(1.8 V 或 3.3 V,按模组规范)
2) 模组输入电源 5 V / 12 V 建立并稳定
3) On-DIMM PMIC 完成软启动,输出 VPP(1.8 V) 与 VDD/VDDQ(1.1 V)
– VPP 与 VDD 的先后关系:VPP 同时或先于 VDD 建立
– 任意时刻满足 VPP >= VDD
– VDD 与 VDDQ 之间通常要求同时或 VDDQ 不晚于 VDD
4) 电源稳定并维持足够时间(典型 >= 200 us 量级)后释放 RESET_n
5) RESET_n 释放后等待 tXPR(量级数百 ns ~ us)才允许发第一条命令
6) ZQCL(长校准)-> tZQINIT 等待
7) 训练序列(详见第 5 章)
8) 正常读写
掉电时序:
a) 停止所有访问,发出 PRECHARGE ALL 关闭所有行
b) 进入自刷新(若需保持数据)或直接下电
c) 拉低 RESET_n(推荐),确保 DRAM 处于确定态
d) 撤除 VDD / VDDQ / VPP:VPP 同时或晚于 VDD 撤除
e) 严禁在 VDD 未撤除时单独撤除 VPP(字线偏置异常风险)
违反后果:
– VDD 上升非单调 / 回勾 -> 内部状态机卡死,表现为上电后不响应
– VPP 晚于 VDD -> 字线驱动不足,读写失败或单元损伤
– RESET_n 释放过早 -> 初始化不完整,训练阶段随机失败
自刷新与掉电保持
| 自刷新(Self-Refresh) | SRE 命令 | 数 mA ~ 数十 mA(随温度上升) | VDD/VDDQ/VPP 均需保持 | 数据保持靠内部刷新;温度越高刷新越频繁、电流越大 |
| 自刷新掉电(SRPD) | 自刷新 + 关时钟 | 更低 | 同上 | CK 可停,进一步省电 |
| 最大省电 / 深度掉电 | 依器件支持情况 | 最低 | 部分器件可断 VDDQ | 需确认退出流程与时间,切勿凭经验操作 |
| 完全掉电 | 直接断电 | 0 | — | 数据丢失;必须按掉电时序执行 |
3.6 功耗与热管理
| 温度传感(TS) | SPD Hub 内置(典型 1~2 点)+ 颗粒内部 MR 温度 | 两路读数应定期交叉核对,偏差过大说明散热或传感器异常 |
| 刷新率切换点 | Tcase ≈ 85 °C | 超过后 tREFI 由 3.9 µs 折半到 1.95 µs,带宽可观测下降 5%~15% |
| 热节流触发 | 由主控按 TS 读数决定,阈值依平台 | 典型行为:降速率 / 降并发 / 限带宽,严重时报错 |
| 模功耗(DDR5 DIMM) | 空闲 2~5 W;满载 10~30 W(依容量与速率) | 服务器满配机箱内是主要热源之一 |
| 散热措施 | 散热片、导热带、强制风道(≥ 1.5 m/s 通过模组表面) | 散热片需与颗粒顶面贴合,导热垫厚度 0.5~1.5 mm |
| 布局避让 | 模组与 CPU / GPU 热源间距 ≥ 20 mm 或加导流 | 避免下游模组处于上游热风出口 |
热节流不是「保护功能」,是性能事故
DDR5 速率越高、功耗越大,且 tREFI 本身只有 DDR4 的一半,高温时进一步折半。工程上应把Tcase ≤ 85 °C 作为硬性设计目标(工温场景按器件规格)。若在整机测试中发现内存带宽随运行时间下降,第一步应读取 SPD Hub 的 TS 与 PMIC 遥测温度,确认是否进入 2× 刷新或节流区,而不是先怀疑信号完整性。
3.7 PDN 目标阻抗与电源完整性
目标阻抗法(板载方案必做,模组方案做输入侧)
Z_target = 允许纹波电压 / 最大瞬态电流
例:VDD = 1.1 V,允许高频纹波 15 mV,最坏阶跃电流 6 A
Z_target = 15 mV / 6 A = 2.5 mΩ
控制频段:
F_max = 1 / (2 x pi x t_r) 或经验取 0.35 / t_r
若电流阶跃上升时间 t_r = 50 ns -> F_max ≈ 7 MHz(由 bulk 与中频电容覆盖)
若 t_r = 5 ns -> F_max ≈ 70 MHz(必须由陶瓷阵列 + 平面电容覆盖)
分层控制建议:
< 100 kHz : VRM 环路 + bulk(聚合物 / 电解)
100 kHz~2 MHz : 中频陶瓷(10 / 22 uF)
2 MHz~80 MHz : 高频陶瓷(0.1 / 0.047 / 0.01 uF)+ 电源/地平面对电容
> 80 MHz : 封装内电容 + 芯片内电容(设计者只能通过平面与过孔优化)
平面电容(薄介质电源地平面对)是最便宜的 >100 MHz 去耦:
采用 2~4 mil 介质(PP 106 / 1080)紧耦合电源地平面,
单位面积电容约 100~250 pF/cm^2,ESL 极低。
| DC 压降(IR Drop) | VRM 到最远端颗粒 ≤ 允许 DC 误差的一半 | 电源完整性 DC 仿真(如 Cadence Sigrity / Ansys SIwave) |
| AC 阻抗曲线 | 目标频段内 Z ≤ Z_target,且无明显反谐振峰 | PDN AC 仿真 + 去耦方案优化 |
| 反谐振峰 | 峰值阻抗 ≤ 1.5 × Z_target | 调整电容容值梯度或增加 ESR(聚合物电容) |
| 瞬态响应 | 峰峰值 ≤ 噪声预算 | 时域仿真 + 实测(示波器 + 电源纹波探头) |
| 实测纹波 | 20 MHz 带宽限制,使用同轴/点测探头 | 禁止使用长接地线(会引入数十 mV 假噪声) |
4 · 典型应用电路
本节给出三种落地形态的原理图(内联绘制):板载颗粒点对点、UDIMM/SODIMM 插槽、RDIMM(含 RCD)。所有网络均按第 6 章的阻抗与等长规则布线。
4.1 板载(down)颗粒点对点方案
DDR5 板载(down)点对点方案 —— 单子通道 32 bit(4 × x8 颗粒)CPU / SoC集成 DDR5 控制器 + PHYCK_A_t / CK_A_cCA_A[13:0]CS_A_nDQ_A[31:0]DQS_A_t/c ×4DM_A_n ×4CB_A[7:0]ALERT_nRESET_nTENLoopback_A / _BHSCL / HSDA(子通道 B 引脚对称存在,本图省略绘制)U1 DDR5 x8 16 GbDQ[7:0] / DQS / DM_n / FBGA-82U2 DDR5 x8 16 GbDQ[15:8] / DQS / DM_nU3 DDR5 x8 16 GbDQ[23:16] / DQS / DM_nU4 DDR5 x8 16 GbUECC DDR5 x8(CB[7:0])校验位颗粒(若主控启用同帧 ECC)CK_A_t/c 差分 80 Ω,Fly-by,等长 ±10 milCA_A[13:0] + CS_A_n:Fly-by 依次串联 4 颗,末端端接RttCA 端接DQ_A[31:0] + DQS_A ×4 + DM_A_n ×4(点对点,每字节组独立等长)DQ 不经 CA 的 Fly-by,直接点对点到对应颗粒CB_A[7:0] 校验位,与 DQ 同帧、同子通道等长10kALERT_n 开漏,需上拉;多 rank 线与10kRESET_n:下拉保证上电为低;建议主控 GPIO 可拉高TEN:正常工作保持无效,预留下拉(电平依 datasheet)Loopback:训练反馈回主控,禁止误接上拉/下拉PMIC / 多路 DC-DC(板载方案自建)5 V 或 12 V 输入 → VDD 1.1 V / VDDQ 1.1 V / VPP 1.8 V需软启动、Power Good、使能时序控制与遥测VIN 5 V / 12 VVDD / VDDQVPP 1.8 V去耦阵列 0.1 µF / 0.01 µF(颗粒背面)240 ΩZQ±1%每颗 DRAM 各配 1 只 240 Ω,距 ZQ 球 ≤ 5 mm,禁止过孔
图 4-1 板载点对点方案:CK/CA/CS 走 Fly-by 并末端端接,DQ/DQS/DM/CB 点对点,PMIC 自建三路电源,ZQ 与去耦贴近颗粒
板载方案逐网络说明
| CK_A_t / CK_A_c | SoC → 4 颗粒 | Fly-by(串接,末端端接) | 末端差分端接(典型 80 Ω 差分,或依 PDG) | 差分对内 ±1~2 mil;全程同层;禁止分支 |
| CA_A[13:0] | SoC → 4 颗粒 | Fly-by | 末端单端端接(典型 40~60 Ω,端接电源依 PDG) | 组内等长 ±10 mil;与 CK 长度差按 PDG(典型 ±20~50 mil) |
| CS_A_n | SoC → 每 rank 一根 | Fly-by(与 CA 同序) | 与 CA 同端接策略 | 单 rank 时可视为 CA 组成员一起等长 |
| DQ_A[31:0] | SoC ↔ 颗粒(每颗 8 bit) | 点对点 | 片内 ODT(DRAM 侧 + 主控侧) | 每字节组与对应 DQS 等长 ±3~5 mil |
| DQS_A_t/c ×4 | SoC ↔ 颗粒 | 点对点差分 | 差分 ODT | 差分对内 ±1~2 mil;与 CK 的长度关系由 write leveling 补偿 |
| DM_A_n ×4 | SoC → 颗粒 | 点对点 | 同 DQ | 与同字节组 DQ 等长 |
| CB_A[7:0] | SoC ↔ 校验颗粒 | 点对点 | 同 DQ | 与 DQ 组等长,长度差纳入同组匹配 |
| ALERT_n | SoC ← 所有颗粒(线与) | 多点 | 上拉 4.7~10 kΩ(电源域依 datasheet) | 走线短、远离高速;预留测试点 |
| RESET_n | SoC → 所有颗粒 | 多点 | 下拉 1~10 kΩ + 可拉高 | 上电期间必须为低;注意复位期间不得浮空 |
| TEN | SoC → 所有颗粒 | 多点 | 下拉(依 datasheet) | 仅测试/训练使用,正常保持无效 |
| Loopback | SoC ← 颗粒 | 点对点 | 不加上下拉 | 反馈训练用,走线等长到主控,禁止并联 |
| ZQ | 颗粒 → 240 Ω → 地(或指定电位) | — | — | 每颗 1 只;≤ 5 mm;1% 精度 |
| VDD / VDDQ / VPP | PMIC → 颗粒 | 平面 / 铜皮 | 去耦阵列见 3.4 | VPP 独立走线与去耦 |
4.2 UDIMM / SODIMM 插槽方案
DDR5 模组方案:主控 ↔ 288 pin 插槽 ↔ UDIMM / RDIMM(含 On-DIMM PMIC 与 SPD Hub)CPU / SoC / BMCCK_A/B、CA_A/B、CS_A/BDQ_A/B[31:0]、DQS_A/BDM_A/B、CB_A/B[7:0]ALERT_n / RESET_n / TENLoopback_A / Loopback_BHSCL / HSDA(管理)GPIO / 在位检测主控侧完成全部训练:CA / WL / RL / VREF /DFE / DCA / Loopback主板电源5 V(UDIMM/SODIMM)或 12 V(RDIMM)288 pin DDR5 插槽(UDIMM / RDIMM) 金手指 30 µ" Au,卡口防呆DDR5 DIMM(模组侧)DDR5 颗粒阵列子通道 A:4~8 颗(32 bit + 8 CB)子通道 B:4~8 颗(32 bit + 8 CB)RCD寄存时钟驱动器(RDIMM 必选)DB / MDB(LRDIMM 才有,缓冲 DQ)On-DIMM PMIC5 V / 12 V → VDD 1.1 V / VDDQ 1.1 V / VPP 1.8 V(SMBus/I3C 可配)SPD Hub+ TS 温度传感SPD 数据 + I3C Hub地址由 SA0~SA2 设定热节流温度上报VDD/VDDQ/VPPHSCL/HSDA模组内部管理总线高速总线:CK / CA / CS / DQ / DQS / DM / CB / Loopback(差分 80 Ω、单端 40 Ω)5 V / 12 V → 模组 PMIC上拉管理侧:ALERT_n 上拉、RESET_n 可控、TEN 下拉输入侧去耦:每条插槽 10 µF ×2~4 + 1 µF ×4~6(见 3.4)主控到插槽走线:6400 MT/s 时建议 ≤ 4~6 inch,含连接器损耗按第 6 章核算
图 4-2 模组方案:主板只送 5 V/12 V 与管理总线,电压调节由 On-DIMM PMIC 完成;RDIMM 的 CK/CA/CS 经 RCD 寄存,LRDIMM 的 DQ 再经 DB 缓冲
插槽方案设计要点
| 插槽选型 | 必须使用 DDR5 专用 288 pin 插槽(与 DDR4 物理不兼容) | 卡口位置与 DDR4 不同;不可混插,也不可用 DDR4 插槽替代 |
| 金手指镀层 | 推荐 30 µ"(0.76 µm)硬金,插拔寿命 ≥ 25 次 | 15 µ" 在多次插拔后接触电阻上升,会影响高速信号 |
| 插槽固定 | 两侧卡扣 + 定位柱;振动场景加锁固件 | 接触不良会表现为训练失败或间歇性报错 |
| 插槽下方布线 | 禁止在插槽正下方走高速线或放置过孔阵列 | 会造成参考平面不连续与插损恶化 |
| 输入电源 | 5 V 或 12 V(按插槽定义),每条独立限流/保护 | 热插拔(若支持)需缓启动与浪涌抑制 |
| 在位检测 | 预留机械/电气检测,避免空载插槽误报 | 多插槽系统按需关闭空槽的时钟与电源 |
| SODIMM | 262 pin,0.5 mm pitch,同样双 40 bit 子通道 | 空间受限,需注意插槽下方禁布区与模组高度 |
| CAMM2 / LPCAMM2 | 压缩连接器,压接方式,走线更短 | 可支持更高速率(8000+);需专用连接器与压接工艺 |
4.3 RDIMM(含 RCD)方案的额外注意
| RCD 引入的固定延迟 | CK/CA 经 RCD 再驱动,主控训练结果需包含 RCD 延迟 | 训练算法由主控 MRC 处理,硬件上只需保证 RCD 供电与旁路电容符合要求 |
| RCD 电源 | 由 On-DIMM PMIC 供电(常见 1.1 V 域) | 模组侧已处理;主板无需额外供 RCD 电源 |
| CA 拓扑改变 | 主控 → RCD → 颗粒(两段) | 主板只负责主控到插槽这一段;段内 Fly-by 由模组完成 |
| DB(LRDIMM) | DQ 也缓冲,往返延迟增加 | 延迟敏感场景慎用 LRDIMM;容量优先时选用 |
| RCD 配置 | 部分平台在训练前需通过管理总线配置 RCD 寄存器 | 确认主控 MRC 支持该 RCD 型号(兼容性清单) |
形态选择小结
速率优先 + 固定配置 → 板载 x16 颗粒(走线最短、无连接器)。容量与可维护优先 → UDIMM/RDIMM 插槽(≤6400 MT/s 稳妥,更高需严格评估通道余量)。空间受限 + 高速 → CAMM2/LPCAMM2。电池供电 → LPDDR5(X),不要用 DDR5。
中文硬件技术文档系列 · DDR5 SDRAM 电路设计指南 · 以目标型号 datasheet 与主控 DDR 控制器设计指南为准
后续章节请下载「芯参谋」查看
……(篇幅原因, 还有10章· 详见芯参谋→方案设计)
当前分享仅开放前 5 章正文。详细资料请在芯参谋客户端中打开完整文档。
打开路径:🔧解决方案&应用市场分析 -> 原理方案设计 -> DRAM系列产品方案 -> DDR5_电路设计指南
📥 下载芯参谋客户端(免费查看)
相关报告 · 1
- 光伏跟踪控制器(Solar Tracker Controller)_市场分析市场应用分析
- Load_Switch_系统设计指南原理方案设计
- MOSFET_量产失效与来料差异_量产排查调试&解决方案
- 分区错位_坏块跳过不一致_量产排查调试&解决方案
- 信创硬件(XC Hardware)_市场分析市场应用分析
相关报告 · 2
- LEDDriver_调光与恒流异常_样机排查调试&解决方案
- eMCP_电路设计指南原理方案设计
- 液冷控制板(CDU)_市场分析市场应用分析
- 扫拖一体机器人(Vacuum-Mop Robot)_市场分析市场应用分析
- SPI_四种工作模式_技术报告调试&解决方案
网硕互联帮助中心





评论前必须登录!
注册