← 返回藏书阁

gpu-server-setup:带分阶段验证门禁的 GPU 服务器配置 Skill

wiki/ai/sources/gpu-server-setup-agent-skill.md
分类:ai / sources · 更新:2026-08-12 09:06

gpu-server-setup:带分阶段验证门禁的 GPU 服务器配置 Skill

深度判断

它是一个窄领域、可操作、验证优先的 agent skill:从 NVIDIA driver/CUDA 到 Docker GPU passthrough,再到 vLLM/Infinity/OpenWebUI/Ollama presets,每层都有 hard gate。 这不是只值得收藏的工具链接,而是能沉淀为 Harness-EngineeringAgent-BenchmarksContext-EngineeringExternal-Agent-Skills-Design-Patterns 的可复用机制样本。

机制 / 一阶原理

  • SKILL.md 负责 workflow 与 hard rules,references/ 承载 driver、Docker、monitoring、troubleshooting 深资料。
  • scripts/check.sh 串起 lspci → nvidia-smi → GPU-in-Docker → service health 的分阶段验证。
  • 明确系统范围:Debian/Ubuntu、x86_64、NVIDIA GPUs;不让 agent 在未知平台上硬猜。
  • 计划/执行分离:live server 上先展示将运行命令,重启前确认,失败 gate 不继续。

与既有 wiki 概念的关系

相关页面:External-Agent-Skills-Design-Patterns · Harness-Engineering · Context-Engineering · Agent-Skill-Discovery

它补充的不是“又一个 agent 项目”,而是一个可迁移的控制/评测/技能设计维度:把模型输出放进更窄的状态机、证据链、权限边界、验证脚本或进化控制面里。

对 Hermes / llm-wiki 的启发

这是 Hermes 可学习的 runbook-skill 模板:窄触发、平台边界、渐进披露、脚本化验证、失败表和安全章节。未来为 CVM、Obsidian sync、向量索引、GPU 推理服务写 skill 时,应采用同样结构。

失败模式与边界

star 数低,且 README 提到作者经验来源而非第三方 benchmark;不应自动安装执行,只学习 skill 结构。

来源

  • GitHub:https://github.com/EvilFreelancer/gpu-server-setup
  • Raw archive:raw/articles/gpu-server-setup-agent-skill-readme-2026-08-12.md

写入记录

  • 2026-08-12 09:00 CST:从 GitHub README 深度入库,提炼深度判断、机制、与既有概念关系、Hermes 实践启发和失败模式。