LINUX SB 快照站

hulk

用户 ID 2243 · 当前名首次快照 2026-08-12 11:12:46 · 当前名始于 2026-08-12 11:12:46 · 原站主页: https://linux.sb/user/2243

发言

共 7 楼

做了一个供agent调度多个服务器和记忆储存的mcp+skill,各位佬可以体验一下给点意见~
#0 · hulk
发帖 2026-08-15 20:55:58 · 快照 2026-08-15 20:57:41

最近在用各种 AI Agent(Claude Code / Cursor / Codex)自动化跑深度学习实验,发现现有的 Agent 基础设施在面向裸机 GPU 集群时,存在几个工程层面的硬伤:

1.上下文截断导致凭证丢失:SSH 私钥、主机配置等上下文数据随着对话轮数增加极易被 LLM 遗忘,导致 Agent 断连后无法恢复现场。
2.算力抢占与状态冲突 (Lock Contention):多个 Agent 实例并发调度机器时,缺乏统一的控制面,高频发生 VRAM 互挤(OOM)和环境覆盖。
3.低效的 I/O 与数据冗余:各个任务实例处于数据孤岛,Agent A 下完的几十 GB 模型权重,Agent B 切进去后由于环境隔离又会重拉一遍。
4.重复陷入相同的环境错误:比如 CUDA out of memory 或 NCCL timeout,Agent 每次都会从零开始去网搜解决方案。

5.agent使用调度多服务器能力欠缺

针对这些场景,我基于 MCP (Model Context Protocol) 规范,用 Cloudflare Workers 和 D1 撸了一个轻量级的算力控制面(Control Plane)。完全无服务器架构,旨在为多 Agent 协同提供一层带“集体记忆”的中间件。

项目地址:https://github.com/ixijxjgxidj-cmd/GPU-Server-Management-MCP-Skill-

识别服务器地址接的英伟达的免费api,实测还挺好用的。
欢迎提修改意见!

免费GLM5.3,救急使用
#0 · hulk
发帖 2026-08-15 01:38:00 · 快照 2026-08-17 20:16:28

一,站点: 美团Tabbit
二,AFF :https://web.tabbit.com/activity/study-invite/D0BD8A9E
三,注册: 手机号注册
四,倍率: 免费GLM-5.3,国际版有gpt,不用排队,周刷新,还有别的主流国模
五,邀请: 签到送3%额度
六,本地反代:https://github.com/hwttop5/tabbit2api

❤️❤️❤️【思辰中转站】大赠送~前500人送$20免费额度!!!(太火了🔥🔥,再补充500人)❤️❤️❤️
#377 · hulk
发帖 2026-08-12 21:23:12 · 快照 2026-08-12 23:00:27

首字速度挺快的,没有掺水,非常的挺稳定,非常的好,使我的项目旋转,可以接入

❤️❤️❤️【思辰中转站】大赠送~前500人送$20免费额度!!!(太火了🔥🔥,再补充500人)❤️❤️❤️
#376 · hulk
发帖 2026-08-12 21:22:29 · 快照 2026-08-12 23:00:27

已成功兑换虚拟卡「新用户7天体验-10美元额度」。

【柏API中转站】评论就送50刀标准额度!再抽10个100刀标准额度
#223 · hulk
发帖 2026-08-12 21:11:03 · 快照 2026-08-16 00:12:26

抽抽抽抽抽抽抽抽抽抽抽抽抽抽抽抽抽抽抽

最后由 hulk 编辑于 2026-08-12 21:11
试一下抽奖功能
#38 · hulk
发帖 2026-08-08 17:24:26 · 快照 2026-08-12 11:12:46

会慢五个字