LINUX SB 快照站

deepseek接入codex后能让deepseek视图生图的方法?

原帖: linux.sb/topic/9354 · 共 18 楼 · 标题快照 2026-08-12 11:09:56

楼主
发帖 2026-08-08 19:26:54 · 快照 2026-08-12 11:09:56

我是一个计算机新手,刚开始学习计算机。这两天下载了codex,由于没有科学上网工具,更想省点钱所以选择了deepseek接入codex,目前是跟着网上瞎做,我发现deepseek作为一个文本大模型无法识图生图,想要求教大佬解决方案。
还有看网上说接入其他模型辅助,我也不会操作,求教程。或者有什么别的方法推荐?
可能表述不好,也没有什么具体要做的项目,学习中:D

#1
发帖 2026-08-08 19:28:40 · 快照 2026-08-12 11:09:56

要接入一个技能吧,我记得是

#3
发帖 2026-08-08 19:33:46 · 快照 2026-08-12 11:09:56

我看他们有外接一个视觉模型的,让有视觉的模型读图然后说给ds

#4
发帖 2026-08-08 19:34:03 · 快照 2026-08-12 11:09:56

@森络盘 #1 具体什么skill?还是要ai一个?

#6
发帖 2026-08-08 19:42:20 · 快照 2026-08-12 11:09:56

外挂mcp 可以看看智谱的

#7
发帖 2026-08-08 19:44:27 · 快照 2026-08-12 11:09:56

我是这样解决的,使用ds-vision-skill-plus,原理是把图片转成详细的文字描述,然后再把这些文字交给ds去处理

#8
发帖 2026-08-08 20:13:08 · 快照 2026-08-12 11:09:56

外接个视觉模型呗,让那个模型读图转述给ds,搜下claude-vision-skill应该能行。

#9
发帖 2026-08-08 20:14:29 · 快照 2026-08-12 11:09:56

DeepSeek 什么时候可以出多模态啊

#10
发帖 2026-08-08 20:27:20 · 快照 2026-08-12 11:09:56

@Custom_Udon #5 我看这个是用于claude的,也可以用于codex吗?

#11
发帖 2026-08-08 20:27:59 · 快照 2026-08-12 11:09:56

@Denia-bot #8 我看这个是用于Claude的,codex也可以吗?

#12
发帖 2026-08-08 20:28:42 · 快照 2026-08-12 11:09:56

@山墨 #7 那做一些人物转动漫的效果会差一点?

#15
发帖 2026-08-08 21:10:55 · 快照 2026-08-12 11:09:56

另外你想让ds生图的话理论上可以加一个ComfyUI的MCP让他自己写工作流和提示词自己跑出来,不过得自己装好ComfyUI找好模型配好MCP。我不清楚你说的人物转动漫指的是什么,如果是真实照片转二次元风格的话可以用ControlNet模型,如果是图生视频的话就找个视频模型也能跑

#16
发帖 2026-08-08 23:28:52 · 快照 2026-08-12 11:09:56

这里得把两件事分开:识图是让视觉模型把图片看明白,生图是让图像模型重新出画。接个 vision skill,通常只能解决前半段;想做“人物转动漫”,最好让支持参考图的图像模型直接拿原图处理,DeepSeek 负责理解需求、整理提示词就行。让纯文本模型隔着一段图片描述再画人,跟让说相声的转述蒙娜丽莎再请人临摹差不多——流程挺热闹,长相容易走亲戚。

#17
发帖 2026-08-08 23:34:40 · 快照 2026-08-12 11:09:56

不行,生图的话,用的是image_gen skill这个skill本质就是指令+ cli ;cli里就是封装调用生图的接口,接口使用的是用户的额度,你如果自己有生图渠道,可以把这个skill抄下来,然后配生图模型;识图原理用hook能解决,本质就是在你文本模型识别之前拦截图片请求,配合其他视觉模型,把图片描述先生成,然后传递给文本模型;这两个都有工具,可以配置,但是你得有生图模型和识图模型,识图模型你可以上glm找个免费视觉模型