探索/大模型

经典大模型arXiv:2302.13971

LLaMA:开放基础模型的分水岭

LLaMA: Open and Efficient Foundation Language Models

Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, Marie-Anne Lachaux, Timothée Lacroix, Baptiste Rozière, Naman Goyal, Eric Hambro, Faisal Azhar, Aurelien Rodriguez, Armand Joulin, Edouard Grave, Guillaume Lample

arXiv · 2023

18k 引用 · 1.6k 阅读 · 0 收藏

摘要

发布 70 亿到 650 亿参数的基础语言模型,用公开数据训练,在多项基准上追平更大的闭源模型。

Releases a series of foundation language models from 7B to 65B trained on public data, matching much larger proprietary models on many benchmarks.

提要

LLaMA 证明:训练配方与数据质量,可以让小一个数量级的开放模型在多项任务上追平更大的封闭模型。它把基础模型研究从 API 黑盒拉回可下载、可微调的公开权重。

01背景与动机

大型语言模型研究曾高度依赖闭源 API,研究者难以检视内部机制,也无法自由保存与微调权重。LLaMA 的动机是提供可复现的基础模型系列,把工作重心从黑盒接口拉回到可获取的参数本身。

此前最强模型多由少数机构掌握,学术与创业团队往往只能间接触达。开放从约七十亿到六百五十亿参数的权重,意在降低门槛,让更多人在同一起点上开展下游研究与应用探索。

02核心方法

模型采用标准的仅解码器 Transformer,训练上强调总 token 规模与公开语料的清洗、混合,以在有限参数下提高样本效率。重点不在发明全新结构,而在把已有可靠做法跑充分。

组件选择偏稳妥,包括旋转位置编码 RoPE、SwiGLU 等已被验证的设计。整体配方突出数据工程与“训满”,用公开数据支撑从 7B 到 65B 的一系列基础模型。

03结果与证据

论文报告在多项常见语言理解与推理基准上,较小规模的 LLaMA 也能达到与参数量大得多的专有模型相当的水平。证据用于支撑“开放、更小但训得更充分”可以具备竞争力,而非单点刷分。

结果叙述围绕跨任务的整体趋势:在公开数据与既定配方下,不必依赖极端参数量也能追平更大闭源系统。文中不把某一孤立分数当作唯一卖点。

04影响与意义

发布后,学术、创业公司与云厂商第一次广泛共享同一条可微调的开源主干,研究不再必须绑定单一厂商 API。下游指令微调、对齐与垂直应用随之快速涌现。

它重写了产业默认假设:谁能训练、谁能改权重、谁能做系统研究。开放基础模型一旦可用,生态协作与分化会同时加速,改变了谁有资格参与前沿工作。

05局限

权重许可条款与训练数据来源在社区中引发持续争议,部分使用场景受合规与授权边界约束。论文给出数据构成的大致类别,但并不等于一份可完整复现的采集与清洗管道。

因此端到端严格复现仍依赖额外工程与数据工作。使用者还需自行评估许可、数据风险与下游安全,不能把论文本身当作开箱即用的全部答案。

06要点

  1. 01开放权重改变了谁能真正开展基础模型研究。
  2. 02小而训满,往往优于大而欠训。
  3. 03基础模型一旦开放,指令微调会爆炸式出现。

为何入典

开源 LLM 生态的原点和坐标系。没有 LLaMA,就没有后来的 Alpaca、Vicuna、Llama 2/3 浪潮。

标签

open-sourceLLM

相关论文

和这篇论文对话

开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。

登录后可以接入自己的模型,向这篇论文提问。