用了几种agent,也都用调用gpt,claude御两家的模型,给一个proposal让它自己补全文献+撰写全文+排版+参考文献插入,都分布一点点跑通了。
但我现在有一个没跑通,就是它没办法帮我作图,或者说拼图。
做review整理,会把参考文献的代表性图拿出来重新拼成组图,放到文章里面;
我在想它能不能自己到各个学术网站,willy,spring等等,下载原图,判断代表数据,然后一个top内容的拼接在一起,直接用于发表;有没有大佬讨论一下,看有没有可能做到!!
原帖: linux.sb/topic/10907 · 共 5 楼 · 标题快照 2026-08-12 10:31:17
用了几种agent,也都用调用gpt,claude御两家的模型,给一个proposal让它自己补全文献+撰写全文+排版+参考文献插入,都分布一点点跑通了。
但我现在有一个没跑通,就是它没办法帮我作图,或者说拼图。
做review整理,会把参考文献的代表性图拿出来重新拼成组图,放到文章里面;
我在想它能不能自己到各个学术网站,willy,spring等等,下载原图,判断代表数据,然后一个top内容的拼接在一起,直接用于发表;有没有大佬讨论一下,看有没有可能做到!!
挺难的,我一直觉得图片格式对于大模型处理起来是非常困难的事情。我也让agent拼过图,效果挺一般的,很难找到正确的位置。
@Lucky-W #1 我有一个想法,就是把拼图做成一个死板的八股文,让它填空。
比如我做一个A4大小画布的psd工程文件,分2X3的布局,让它下载原图,插入到里面。
之后自己打开这个psd文件对里面的图层简单裁剪。
但我没token了,试不了
下载原图这个功能现在很多搜索/爬虫工具都能做到。对于内容的平接,如果是将图片内容进行拼接,当前Figma就可以做到。
个人认为AI学术最重要的就是检索能力,减少幻觉的出现。一篇paper需要将paper进行模块化。比如part1,2,3等等。这些part可以是开发者自己设定,也可以是AI进行划分。然后给到subagent去完成。这样可以减少上下文避免幻觉。当前业界为了提高学术检索和生成的准确性,常规做法就是让LLM将检索回来的内容简明重点的概括一下,或者去填一个to-do list。这需要根据模型而定,你说你用的claude系列模型,在claude自己的技术报告说明,对于opus系列模型,to-do list会降低自身的推理能力。(当然这些技术报告也不能全信,因为这个逼养的在关于claude code技术报告说自家Agent用的工具是不多的,就20多个,结果源码一泄露50多个工具)
其实更好的做法是交互式,用户提问,plan_agent根据用户的问题进行规划和追问。然后调用一个coding_agent根据规划创建sub_agent。由这些sub_agent完成每个段落。你说的图片可以专门的创建一个sub_agent去完成。当然这个架构开发难度可能稍高,好处是适应性和个性化很强。
@answeryt #3 感谢大佬!"交互式,用户提问"这个做法我写自己的正经article的时候再用,但有点想更懒省事,直接把综述一类的内容丢给他,我尝试一下,正好今天gpt重置了,感谢大佬。