楼主
采用纯JS架构,可以多线程推理,最后能达到一秒一个token左右
模型还是比较傻的,1+5的和再乘3都有时算不清楚。
模型有1个G。不要反复下载把我的流量耗光。
https://www.altzin.com/llm/chat.php
原帖: linux.sb/topic/10920 · 共 11 楼 · 标题快照 2026-08-12 10:30:57
采用纯JS架构,可以多线程推理,最后能达到一秒一个token左右
模型还是比较傻的,1+5的和再乘3都有时算不清楚。
模型有1个G。不要反复下载把我的流量耗光。
https://www.altzin.com/llm/chat.php
打开就下一个g吓哭了
666
@哈雷彗星 #1 吓我一跳
我最近也在用小模型 用的 qwen3 1.7b 你别说 还挺可以
模型就这么大 我也没办法…更小的模型推理能力超差@哈雷彗星 #1
@altzin #5 我的意思是搞个手动触发和停止下载并删除 有1个g的用不到的缓存文件并且我还知道了 强迫症难受死了
2.5很差,3好很多吗@嘿嘿喵喵 #4
@altzin #7 我又不是浏览器用 我是本地 ollama 但是我那个nas 很烂是 i3-6100
提示词给的 足够准确 看着还是很理想
比如 你有10个表格 每个表格的col-name都是不同的 但是大体格式是一样的
我们正常开发 可能需要 创建一堆 key value 形式来满足或者json话这一堆表格
但是你如果用 小模型 提示词锁进 他能直接给你返回一个json结构体...这是我的应用场景
@altzin #7 我用了 2 和2.5 感觉 3确实 好一些 感觉 比 2.5的 3b 4b 都好一些
直接下载模型这么哈人,应该改成手动下载,不是自动下载