LinkedIn 如何通过多教授蒸馏将 AI 求职训练速度提高 8 倍
LinkedIn 发布了其人工智能求职背后的培训基础设施的详细信息,描述了一个多教师蒸馏管道,该管道将大型教师模型的知识压缩为紧凑的 0.6B 参数分类模型。主要贡献不仅在于蒸馏技术。正是系统的工作使其速度足以进行迭代。这包括一个基于 SGLang 构建的自定义框架,该框架直接将教师模型提供给训练周期。 训练小语言模型 (SLM) 以提高相关性和参与度目标(例如点击次数和应用程序)需要为每个训练示例查询一个或多个大型教师模型。跟随这些老师可能会减慢这个过程。这成为排名系统的瓶颈,该系统每秒必须处理 LinkedIn 规模的数十万个查询。许多搜索和推荐团队面临着共同的挑战。他们很难从基于关键字的系统转向由法学硕士监督的统一分类器。 LinkedIn 使用 SGLang 为几位教师创建了一个蒸馏框架。该系统加载并提供不同尺寸的教师模型。它还处理张量并行和数据并行配置。异步客户端在培训期间询问教师。处理它们的输出并将它们添加到蒸馏损失中。该团队将这种方法称为“在线多教师蒸馏”。使用本地教师副本将其扩展到多个节点,将蒸馏过程加快了 3 倍。它还保持较低的延迟,从而允许快速迭代。为了减少服务开销并避免重复计算,LinkedIn 引入了 Offline Multi-Professor Distillation。在此模式下,系统预先计算教师输出并将其存储在 HDFS 或 NFS 中。然后将它们直接用于训练,而不是实时查询。 教师/学生培训全额 这种在线/离线分离与更广泛的训练级优化堆栈并存:采用 LiGer 减少内存使用并实现 2…