LINUX SB 快照站

做了一个供agent调度多个服务器和记忆储存的mcp+skill,各位佬可以体验一下给点意见~

原帖: linux.sb/topic/12857 · 共 3 楼 · 标题快照 2026-08-15 20:57:41

楼主
发帖 2026-08-15 20:55:58 · 快照 2026-08-15 20:57:41

最近在用各种 AI Agent(Claude Code / Cursor / Codex)自动化跑深度学习实验,发现现有的 Agent 基础设施在面向裸机 GPU 集群时,存在几个工程层面的硬伤:

1.上下文截断导致凭证丢失:SSH 私钥、主机配置等上下文数据随着对话轮数增加极易被 LLM 遗忘,导致 Agent 断连后无法恢复现场。
2.算力抢占与状态冲突 (Lock Contention):多个 Agent 实例并发调度机器时,缺乏统一的控制面,高频发生 VRAM 互挤(OOM)和环境覆盖。
3.低效的 I/O 与数据冗余:各个任务实例处于数据孤岛,Agent A 下完的几十 GB 模型权重,Agent B 切进去后由于环境隔离又会重拉一遍。
4.重复陷入相同的环境错误:比如 CUDA out of memory 或 NCCL timeout,Agent 每次都会从零开始去网搜解决方案。

5.agent使用调度多服务器能力欠缺

针对这些场景,我基于 MCP (Model Context Protocol) 规范,用 Cloudflare Workers 和 D1 撸了一个轻量级的算力控制面(Control Plane)。完全无服务器架构,旨在为多 Agent 协同提供一层带“集体记忆”的中间件。

项目地址:https://github.com/ixijxjgxidj-cmd/GPU-Server-Management-MCP-Skill-

识别服务器地址接的英伟达的免费api,实测还挺好用的。
欢迎提修改意见!

#1
发帖 2026-08-15 20:58:35 · 快照 2026-08-15 20:59:56

#2
发帖 2026-08-15 21:15:05 · 快照 2026-08-15 21:16:33

@hulk 真正的大佬来了,虽然我现在看不懂,但是我收藏帖子了,别给我删,我研究研究😋