rag-evaluation-checklist
Evaluate retrieval quality, answer grounding, and regression risk with explicit checks.
42.8K
Installs · NEW
Capability · rank 16
Find missing traces, weak evaluations, and operational blind spots in agent systems.
Reviews agent observability: traces, tool calls, eval hooks, cost/latency signals, and incident readiness.
npx skills add skillforge/ai-engineering --skill agent-observability-reviewerReviews agent observability: traces, tool calls, eval hooks, cost/latency signals, and incident readiness. Review the sandbox comparison, limitations, permissions, and pinned version before install.
Outcome
Find missing traces, weak evaluations, and operational blind spots in agent systems.
Who it is for
Platform teams operating multi-step agents in production.
What it is not for
Generic APM setup with no agent-specific workflows.
Runtime export
codex_skill · markdown_export
npx skills add skillforge/ai-engineering --skill agent-observability-reviewer1 / Prompt
Review our agent tracing plan before launch
2 / Prompt
Identify observability gaps in this tool-calling workflow
Audience
Platform teams operating multi-step agents in production.
Not for
Generic APM setup with no agent-specific workflows.
Jun 25, 2026current
Beta reviewer pack