AI竞争白热化 张一鸣喊「拒绝蒸馏」:不利用他人的输出换排名
17分钟前
中国科技大厂字节跳动创办人张一鸣近日罕见发声,强调公司内部「拒绝蒸馏」,认为做模型应坚持长期主义,而非用别人的输出换取一时榜单排名。(路透)
中国 AI大模型竞争持续升温之际,美国近1年来也持续指控部分 中国 大模型通过「蒸馏」(distillation)方式学习美国AI模型能力。 中国 科技大厂「字节跳动」创办人张一鸣近日罕见就模型研发路线表态,强调公司内部「拒绝蒸馏」,认为做模型应坚持长期主义,而非用别人的输出换取一时榜单排名。
澎湃新闻报导,张一鸣鲜少在旗下AI开发的Seed团队会议上发言,但在AI竞争白热化背景下他罕见发声。有字节跳动内部人士透露,今年 中国 竞争对手开源模型快速发展,给字节跳动带来更大压力。在近日内部会议中,张一鸣表示,做模型要坚持长期主义、延迟满足感,而不是利用他人的输出换取一时榜单排名,字节跳动「应该愿意为长期目标牺牲一部分短期收益」。
报导指,今年以来, 中国 AI大模型竞争激烈,几乎每隔数天就有新模型发布。随着强大的开源新模型陆续推出,字节跳动内部关于是否采用蒸馏技术的讨论升温。
据了解,字节跳动内部对开源模型严禁蒸馏,甚至通过API检测等方式,在内部加强相关限制。张一鸣认为,蒸馏会干扰真正意义上的长期技术突破。
此前,美国科技媒体The Information提到,字节跳动员工表示,字节跳动不愿使用蒸馏,被视为其大型语言模型落后于 中国 其他AI实验室的原因之一。不过,报导也指出,字节跳动是 中国 主要AI公司中,唯一一家大型语言模型几乎全部采用专有模型(闭源模型)的企业,而其他同业则多专注于开源模型。
字节跳动员工称,Seed团队内部关于是否应转向蒸馏的争论由来已久。今年,随 中国 竞争对手开源模型快速进步,尤其每当 中国 有新的强大开源模型发布,相关讨论再次升温。蒸馏可节省大量训练时间和算力成本,因为新模型可直接学习现有前沿模型的推理步骤,而不必完全依赖原始及筛选后的训练数据。
与此同时, 中国 国产大模型竞争持续升温,各家模型厂商加速推出新品。6日稍早,DeepSeek发布公告表示,计划近期整体上调DeepSeek API服务定价,预计涨幅较大,具体方案将以正式通知为准。
7月31日,DeepSeek宣布DeepSeek-V4-Flash正式版API上线公测。据悉,DeepSeek-V4-Flash-0731模型结构、规模与DeepSeek-V4-Flash-preview保持一致,仅重新进行后训练。业内人士分析,此次宣布涨价,也意味DeepSeek即将推出V4-Pro正式版,可能对整体算力调用产生影响。

Comments