
龙明
Agent可观测追踪与调试32篇
2026-08-31 03:16:31
Agent 一旦出错,你在看什么?这组 32 篇讲可观测体系怎么搭:tracing 标准(OpenLLMetry 等)、session replay、token 与成本监控、失败模式分类,以及 Langfuse、LangSmith 这类平台的实际使用心得。生产环境排障的案例复盘占了不少篇幅,都是踩坑换来的。agent 上线之前,先把这组里的监控清单配齐。
traceloop/openllmetry

GitHub可观测
Arize-ai/phoenix

GitHub可观测
comet-ml/opik

GitHub评估
langfuse/langfuse

GitHub可观测
wandb/weave

GitHub可观测
OTel GenAI Semantic Convention

OpenTelemetry规范
pydantic/logfire

GitHub可观测
Helicone/helicone

GitHub网关
OpenObserve: Unified Observabi
统一SaaS
Braintrust

评估SaaS
Building Observable AI Agents

Temporal可观测
Introducing BigQuery Agent Ana

GoogleCloud分析
Distributed Tracing for Agenti

RedHat分布式
Red-Teaming Anthropic's Intern

METR红队
future-agi/future-agi

GitHub评估
mikehasa/agentacct

GitHub成本
AgentOps-AI/agentops

GitHub可观测
matt1398/claude-devtools

GitHubClaude
kerlenton/mcpsnoop

GitHubMCP
Claude Code `/doctor`

Claude诊断
Syncause/debug-skill

GitHub调试
AgentTrace: Causal Graph Traci

arXiv论文因果
TraceCoder: A Trace-Driven Mul

arXiv论文轨迹
AgentRx: Systematic Debugging

微软调试
Debugging Deep Agents with Lan

LangChain调试
Where LLM Agents Fail and How

arXiv论文失败
evilmartians/agent-prism

GitHub可观测
Characterizing Faults in Agent

arXiv论文故障
More Visibility into Copilot C

GitHubCopilot可观测
AgentStepper: Interactive Debu

arXiv论文交互
cosmtrek/mindwalk
GitHub调试
QoderAI/better-harness

GitHub调试
评论
暂无评论,快来发表第一条评论吧