第三方把 Kimi 的视觉编码器接到 DeepSeek V4 Flash 上的实验模型。
给只会读书的学霸配上眼睛,镜片还是从隔壁 Kimi 借来的——两边脑子都不动,中间只焊了个转接头。
可做基础图像理解实验,尚未经过大规模生产验证。
DeepSeek
该项目以 DeepSeek V4 Flash 文本骨干为基础改装。
Kimi
它的看图能力直接借用 Kimi K2.6 的视觉编码器 MoonViT。
Vision-Language Model
两套骨干拼在一起,成为视觉语言模型的实验实现。
Fine-tuning
项目冻结两套骨干,仅训练连接它们的投影层。