故障排查
EthanKit agent、模型、MCP、飞书、记忆、评测和定时任务出现异常时的排查顺序。
先看权限
如果按钮不存在,或者进入某个页面后被带回 Dashboard,先确认当前账号是否是管理员。Viewer 模式不能运行 agent、保存配置或访问 admin-only 页面。
Agent 不能运行
按这个顺序检查:
- Agent 是否选择了可用模型。
- 模型配置是否通过 Test。
- 当前账号是否是管理员。
- Trace 里是否有模型、工具或权限错误。
- 如果启用了 MCP,检查对应 MCP 是否连接成功。
- 如果启用了 Memory,检查 workspace 和 embedding 配置。
没有模型可选
进入 模型配置,新增至少一个 BYOK 模型。保存后测试连接,再回到 Agent Builder。
如果是 embedding 相关问题,检查是否已经添加 embedding model,并在 workspace 中选择了它。
MCP 工具不可用
检查:
- MCP 配置是否 Enabled。
- MCP server id 是否和 agent 挂载的 id 一致。
- Test 是否显示连接成功和工具数量。
- HTTP MCP 的 URL 和鉴权 header 是否仍有效。
- GitHub PAT 是否仍有目标仓库权限。
如果是 workflow 的 Vercel 5xx Logs 节点失败,检查 Vercel PAT 是否启用并通过测试。
素材库没有显示能力块
检查:
- 当前时间和 HTTP Fetch 是固定内置工具;若缺失,检查前端版本是否与 API 一致。
- Memory 能力是否本来就是固定能力块。
- 自定义 MCP 是否 Enabled。
- GitHub PAT 是否保存成功并生成 MCP server id。
- Vercel PAT 是否被误认为 agent MCP;它用于 workflow,不出现在 Agent Builder。
- Sub-agent 后端是否在当前环境可用。
如果工具出现在素材库但 agent 无法调用,确认已经在 Agent Builder 中把该工具挂载到当前 agent 并保存。未绑定的内置工具不会进入运行环境。
看板没有运行任务
看板只展示当前 running 任务。如果任务已经完成或失败,它不会继续留在看板上。去对应 agent 历史、eval 结果或 schedule run history 查看结束后的记录。
如果你确定任务还在运行但看不到,刷新页面,并确认任务来源是 Console 或 Feishu。
飞书群没有回复
检查:
- 绑定状态是否 ACTIVE。
- 飞书应用是否已发布最新权限。
- 机器人是否加入目标群。
- 事件订阅 callback URL 是否正确。
- Reply policy 是否要求 @ 机器人。
- Agent 是否能在 Web 控制台里正常运行。
记忆不生效
检查:
- Agent 是否启用 Memory。
- 是否选择了正确的 memory workspace。
- 召回数量是否过低。
- 是否配置了 embedding model。
- Memory 页面里是否存在相关 active records。
如果 agent 持续引用旧信息,清理错误 memory record 后重新运行。
知识库流水线失败
检查:
- Knowledge 页面是否显示已配置。
- Source URLs 或 Sitemap URLs 是否可访问。
- Max URLs 是否过小,导致没有选中目标页面。
- Dry run 是否能发现 URL。
- Run logs 里失败发生在 crawl、extract 还是 mine terms。
- Chunks 是否仍处于 pending 或 rejected,导致可用知识不足。
定时任务没有触发
检查:
- Task 状态是否 ACTIVE。
- Cron 表达式是否符合预期。
- 时区是否正确。
- 目标 workflow、agent 或 eval experiment 是否仍存在;experiment 引用的 revisions 是否完整。
- 手动 Run now 是否能成功。
- ACTIVE 任务是否依赖未配置的 Vercel、GitHub、飞书或模型凭据。
建议先手动运行一次,确认依赖和输出都正常,再打开定时触发。
评测结果异常
检查:
- Dataset revision 的 case、可信 expected label 和 rubric 是否完整。
- Candidate/control target revision 是否选对,依赖 hash 是否仍可执行。
- Grader-set revision 的 implementation、judge model 和 prompt revision 是否可用。
- Attempt detail 中失败的是 target execution、grader,还是 experiment threshold。
replay_consistency 只说明输出稳定,不代表业务正确。高风险任务要结合 typed metrics、trace evidence 和人工复核。
Sub-agent Lab 无法启动
检查:
- 当前账号是否是管理员。
- 是否至少有一个 chat model。
- 目标 sub-agent 是否显示 configured。
- Start URL 是否有效。
- Browser stream 不显示时,先看 Result 和 Trace;有些后端可执行浏览器任务,但不提供实时画面。