云计算百科
云计算领域专业知识百科平台

【AI黑话日日新】Day 034|Scaling Law(缩放定律)

在这里插入图片描述

一句话说清:把模型做大、数据喂多、算力加足,它的表现会按一条可预测的数学曲线变好。

1. 它到底在说什么

Scaling Law 翻译过来是“缩放定律”,但说人话就是一句话:你给模型更多资源,它就更稳定地变强。这里的资源有三样——模型的“体量”(参数)、喂给它的“粮食”(训练数据)、以及烧的“电”(算力)。关键不在于“变强”,而在于“可预测”:不是试出来的,而是能提前算出来的。

打个比方,这就像给一个学生加练习量。你没法保证练得越多分数一定线性上涨,但教学经验告诉我们,在相同方法下,练习量从 100 套题加到 1000 套题,平均分通常会按一个稳定、可估计的幅度提高。Scaling Law 就是把这种“经验规律”写成了一条数学曲线,让公司能在烧几千万美元训练模型之前,先估算出它能到什么水平。

2. 为什么现在这个词很热

这个词不是新词,但它的热度曲线很有意思。

2020 年 1 月,OpenAI 的 Jared Kaplan 等人发表了《Scaling Laws for Neural Language Models》,第一次系统证明:语言模型的“损失”会和参数、数据、算力分别呈幂律(power law)下降。这条发现直接给后面的 GPT-3(1750 亿参数,2020)和 GPT-4(约 2023)铺了路,

赞(0)
未经允许不得转载:网硕互联帮助中心 » 【AI黑话日日新】Day 034|Scaling Law(缩放定律)
分享到: 更多 (0)

评论 抢沙发

评论前必须登录!