This Is The True Distillation
#1 · open · 2 comments
View on GitHub ↗
Rimo还是有点超脱于人类范畴了,看完这篇文章我已经震撼的语无伦次了,请让我组织以下语言:
1. 权重有考虑开源吗
2. 如果重新设计训练后模型的VAE,让Decoder支持4通道输入+16通道输出,会不会比直接强行分组4x4然后平均效果会好一点
3. Clip这一块能跑通是不是因为直接冻结了OpenCLIP-ViT/bigG这一层clip。那这种clip不通用甚至没用clip的Qwen怎么用稍微阳间点的方式对齐clip,真的要手动加一层mlp处理映射吗🫠
4. 这套方案能不能用于llm微调当中,通过直接提取隐层向量来训练(而不是和普通蒸馏一样在模型输出文本后再次训练),貌似还能减少显存和内存交换
Comments
另外对于这种Latent映射我保持强烈反对意见,在我看来已经纯属大力出奇迹范畴了。能输出这种效果我的评价还是死二次元的特征还是太过强烈,能在经历如此不可名状的处理后还能顽强的展现出来。(太震撼了)
咦,我好像不小心把这个repo的watch点掉了,之前没收到通知。
1. 权重就不开源了。因为效果不好,等下没有人会想用这个推理,而且也没有人想微调SD3.5。
2. 实际上2个transformer本身已经在不同的latent space上运行了,所以不是VAE的问题,改latent space再训的话它收敛应该就没有这么快了。
3. CLIP是冻结的,然后Qwen的话正好我这几天正好试Flux2-klein,测试发现不换CLIP的话对角色名的响应很差。其实加1层MLP已经是比较阳间的方式了,不阳间的方法那就把Qwen直接丢了、或者把clip embedding直接concat在Qwen后面……
4. 我不那么确定,但我猜正规的LLM蒸馏应该也是拿概率输出去训的?
5. 虽然最后这不是1个问题但是我也回答1下。其实RUM的核心思想是「消除随机性带来加速」,Latent映射其实只是为了在训练时有1组合理的IO让它能跑,所以可能有性质更好的映射,但是现在这个做法已经足够快了。