LinkedIn 发布了其人工智能求职背后的培训基础设施的详细信息,描述了一个多教师蒸馏管道,该管道将大型教师模型的知识压缩为紧凑的 0.6B 参数分类模型。主要贡献不仅在于蒸馏技术。正是系统的工作使其速度足以进行迭代。这包括一个基于 SGLang 构建的自定义框架,该框架直接将教师模型提供给训练周期。
训练小语言模型 (SLM) 以提高相关性和参与度目标(例如点击次数和应用程序)需要为每个训练示例查询一个或多个大型教师模型。跟随这些老师可能会减慢这个过程。这成为排名系统的瓶颈,该系统每秒必须处理 LinkedIn 规模的数十万个查询。许多搜索和推荐团队面临着共同的挑战。他们很难从基于关键字的系统转向由法学硕士监督的统一分类器。
LinkedIn 使用 SGLang 为几位教师创建了一个蒸馏框架。该系统加载并提供不同尺寸的教师模型。它还处理张量并行和数据并行配置。异步客户端在培训期间询问教师。处理它们的输出并将它们添加到蒸馏损失中。该团队将这种方法称为“在线多教师蒸馏”。使用本地教师副本将其扩展到多个节点,将蒸馏过程加快了 3 倍。它还保持较低的延迟,从而允许快速迭代。为了减少服务开销并避免重复计算,LinkedIn 引入了 Offline Multi-Professor Distillation。在此模式下,系统预先计算教师输出并将其存储在 HDFS 或 NFS 中。然后将它们直接用于训练,而不是实时查询。

这种在线/离线分离与更广泛的训练级优化堆栈并存:采用 LiGer 减少内存使用并实现 2 倍大的批量大小,多节点训练可实现高达 3.5 倍的额外加速,FSDP2 可额外提高 20%,H200 多节点集群可提高高达 30%。该团队指出,它评估了 FP8 的混合精度,但发现具有 8B 参数的模型没有任何好处,因为启动开销超过了计算节省。叠加起来,这些优化就是帖子标题中提到的大约八倍的训练加速的原因。
在建模方面,LinkedIn 研究表明 0.6B 学生模型改善了求职结果。这个模型来自8B相关性预言机和1.7B承诺老师。求职的NDCG@10上升了24.48%,从0.7583上升到0.9432。在同一调查中,推理方面的工作包括结构化修剪和上下文压缩。这些方法将每个 GPU 的分类性能从每秒约 290 个项目提高到超过 2,000 个项目。
该系统已投入使用,为美国 LinkedIn 用户提供自然语言职位搜索。它基于 SGLang(LinkedIn 投资用于预分类工作负载的开源 LLM 服务引擎)而不是专有的服务堆栈。 LinkedIn 将这项工作作为团队指南。它帮助他们实现跨编码器质量评级,同时满足实时延迟需求。此外,它通过对每个请求使用前沿 LLM 推理来避免高成本。
由LLM监督创建类似评分系统的团队可以使用线上和线下教师服务部门。当教师选择发生变化时,他们可以在早期阶段进行在线查询。一旦教师稳定并且查询量增加,他们就可以切换到离线缓存。盈利令人发指,而不仅仅是一个噱头。 LiGer、多节点数据并行、FSDP2 和新一代 GPU 都带来了适度的提升。此外,对于低于 8B 的型号尺寸,这些都不需要 FP8。对于将较低准确度视为默认值的团队来说,此细节非常重要。
2026 年 6 月,Pinterest 推出了一个名为“实现 Pinterest 基础模型的近线性训练可扩展性”的相关帐户。本文解释了多节点训练如何帮助创建更大的教师模型。这些模型的知识随后被开发成更有效的学生模型,用于 Homefeed 和相关 Pin 图的分类。这个过程将实验周期从几周缩短到了一小部分。 LinkedIn 的作用是创建一个定制的 SGLang 框架,允许教师在培训期间进行现场咨询。
Pinterest 专注于扩展训练框架,并正在迁移到分布式检查点,这使得多节点教师训练成为可能。最近的一项调查《2026 年蒸馏(迄今为止):哪些前沿模型使用它以及如何使用》强调了多教师蒸馏的进展。它采用 NVIDIA 的 Nemotoron 3 Ultra、MiMo-V2-Flash 和 DeepSeek-V4,使用 10 名或更多专业教师进行令牌密集监控。教师库的复杂性超出了 LinkedIn 和 Pinterest 等行业排名系统的需求,这些系统使用的特定任务教师较少。