搞科研的Bi u们都知道,写得好不如图画的好,最终的图片的质量会给审稿人的观感带来很大的影响。我们开题汇报/毕业汇报等等场景,都是要求我们需要画好图,讲好故事。所以,一张好图就奠定了一个好故事的根基。
三个痛点问题:
1. 科研论文图方法论写完了,但是核心技术路线图无思路,不知道如何排版。
2. 毕业汇报,组会汇报,学术会议汇报等ppt制作无思路,不会内容编排与单页设计。
3. 传统image模型生成出来的风格不统一,具有随机性,内容丰富度忽高忽低。
项目核心功能:
解决以上三个痛点问题
1. 给出论文材料和约束规范,选中提供的template,风格约束,完成与顶会论文同样风格设计,内容排版相同的个人论文技术路线图
2. 给出制作ppt借鉴的材料和单页模板,设定页数,自动识别母版设计组件,强风格一致,自动化制作高质量成品ppt
3. 设置三种类型的model共同协作,design,implement,search。从设计编排到网络现实素材搜索到制图一条龙生成高质量图片。
模型配置介绍
1. design model :规划模型(需要支持多模态输入),负责对用户上传的资料/图片进行深度理解,编排目标成功图片的内容与布局,生成最终的制图描述。强风格一致性约束来自于template底图。支持OAI/Anthrophic协议。
2. implement model : 制图模型,负责接收design model的输出内容,制作最终的效果图。上游模型,自行搜索生图公益站,只要支持api调用。
3. search model :搜索模型,负责抽取出用户输入资料/图片中的实物素材,如硬件实物(雷达,相机,无人机等),软件产品(claude code,codex, pi)等。复用现实网络素材图片,辅助design model进行规划,抑制图像编造,并丰富图像展示效果。可配置grok seach model,服务可参考grok2api项目,配置grok-search。
这一点是我在实际使用体验当中总结出来的,直接与制图模型交互,如gpt-image-2,nano-banana-2 等,得到的图片内容丰富度不一,且容易出现与现实不符的图像素材。
使用方式
开箱即用,轻量化桌面端应用程序/本地端口部署webui
项目链接:
https://github.com/dream-rec/dreampaper
姊妹项目链接:
https://github.com/dream-rec/dreamcode
如果对您有帮助的话,可以帮忙点个小star⭐️⭐️⭐️
因为效果案例图是4k的,比较大,我就不上传到这里了,可以移步仓库主页进行预览。