楼主 · 历史 (1)
如题,大家在调用Deepseek时是怎么解决多模态问题的.....
特别是用 HyperFrames 这类工具做动画时,做的特别烂
原帖: linux.sb/topic/12083 · 共 5 楼 · 标题快照 2026-08-13 11:33:05
如题,大家在调用Deepseek时是怎么解决多模态问题的.....
特别是用 HyperFrames 这类工具做动画时,做的特别烂
视觉的话 我建议给一个md文档 里面放置一个拥有视觉模型能力的 API(如 gpt-5.6-luna) 约束会话中 涉及到视觉的 调用后并解析
反馈到ds再进行
让AI做个MCP,放个有视觉能力的VLM的api进去(MIMO那种都行),检测到视觉相关任务让他自己调用
本身就没多模态吧?只能靠mcp
可以用 qwen 这个多模态插件 https://github.com/QwenLM/Qwen-MM-Plugins