gpu-server-setup:带分阶段验证门禁的 GPU 服务器配置 Skill
gpu-server-setup:带分阶段验证门禁的 GPU 服务器配置 Skill
深度判断
它是一个窄领域、可操作、验证优先的 agent skill:从 NVIDIA driver/CUDA 到 Docker GPU passthrough,再到 vLLM/Infinity/OpenWebUI/Ollama presets,每层都有 hard gate。 这不是只值得收藏的工具链接,而是能沉淀为 Harness-Engineering、Agent-Benchmarks、Context-Engineering 或 External-Agent-Skills-Design-Patterns 的可复用机制样本。
机制 / 一阶原理
- SKILL.md 负责 workflow 与 hard rules,references/ 承载 driver、Docker、monitoring、troubleshooting 深资料。
- scripts/check.sh 串起 lspci → nvidia-smi → GPU-in-Docker → service health 的分阶段验证。
- 明确系统范围:Debian/Ubuntu、x86_64、NVIDIA GPUs;不让 agent 在未知平台上硬猜。
- 计划/执行分离:live server 上先展示将运行命令,重启前确认,失败 gate 不继续。
与既有 wiki 概念的关系
相关页面:External-Agent-Skills-Design-Patterns · Harness-Engineering · Context-Engineering · Agent-Skill-Discovery。
它补充的不是“又一个 agent 项目”,而是一个可迁移的控制/评测/技能设计维度:把模型输出放进更窄的状态机、证据链、权限边界、验证脚本或进化控制面里。
对 Hermes / llm-wiki 的启发
这是 Hermes 可学习的 runbook-skill 模板:窄触发、平台边界、渐进披露、脚本化验证、失败表和安全章节。未来为 CVM、Obsidian sync、向量索引、GPU 推理服务写 skill 时,应采用同样结构。
失败模式与边界
star 数低,且 README 提到作者经验来源而非第三方 benchmark;不应自动安装执行,只学习 skill 结构。
来源
- GitHub:https://github.com/EvilFreelancer/gpu-server-setup
- Raw archive:
raw/articles/gpu-server-setup-agent-skill-readme-2026-08-12.md
写入记录
- 2026-08-12 09:00 CST:从 GitHub README 深度入库,提炼深度判断、机制、与既有概念关系、Hermes 实践启发和失败模式。