AgentBench

AI Agent 智能评测平台

面向大语言模型 Agent 的自动化评测平台 —— 评测维度自定义、批量自动化评测、Prompt / RAG / Tool 多层归因分析、数据治理与 Langfuse 全链路可观测性

LangChain Langfuse FastAPI Streamlit ChromaDB
GitHub 仓库 查看文档

核心功能

覆盖 AI Agent 评测全链路的六大模块

📋

评测集管理

支持手动录入、JSON 批量导入,自定义评测维度与评分标准,版本管理确保评测数据可追溯

🤖

三类 Agent 评测

基于 LangChain 构建 Prompt / RAG / Tool 三类 Agent,覆盖纯推理、检索增强、工具调用三大场景

⚖️

LLM-as-Judge 评分

多维度自动评分:准确性、安全性、流畅性、任务完成度、幻觉检测,每个维度都有详细的评分标准

🔍

三层归因分析

自动定位 Agent 失败根因:Prompt 层(指令设计)、RAG 层(检索召回)、Tool 层(工具调用),并生成优化建议

📦

数据治理

统一标签体系、数据质量校验(重复/缺失/异常检测)、统计口径管理,确保评测数据可靠可信

📡

Langfuse 可观测性

全链路 Trace 追踪,Span 级分析(检索/生成分阶段),评测指标自动上报,支持跨实验对比

系统架构

清晰的分层架构设计,模块化可扩展

AgentBench Architecture
AgentBench 系统架构 — 前端层 / 服务层 / 数据层

评测流水线

从数据加载到报告生成的完整自动化流程

📂
评测集加载
🤖
Agent 执行
📡
Langfuse 追踪
⚖️
多维度评分
🔍
归因分析
📊
报告生成
Evaluation Pipeline
评测流水线详细流程

三层归因分析

自动定位 Agent 失败根因,生成针对性优化建议

Prompt 层

  • 指令清晰度检测
  • Prompt 注入风险识别
  • 角色定义充分性评估
  • Prompt 变体效果对比

RAG 层

  • 检索召回率分析
  • 上下文相关性评估
  • 幻觉内容检测
  • 知识库覆盖度检查

Tool 层

  • 工具选择正确性
  • 参数构造准确性
  • SQL 生成正确性验证
  • API 调用格式检查

可视化看板

Streamlit 构建的交互式评测看板,直观展示评测结果与归因分析

AgentBench Dashboard
评测结果看板 — 核心指标、维度雷达图、归因分布

技术栈

精心选型,覆盖 AI 应用开发全链路

FastAPI
高性能异步后端
LangChain
Agent 编排框架
Langfuse
LLM 可观测性
ChromaDB
向量数据库
Streamlit
交互式前端
OpenAI API
LLM 推理引擎
Pandas
数据处理
Docker
容器化部署

快速开始

三步启动你的第一个 Agent 评测

# 1. 克隆项目并安装依赖
git clone https://github.com/LW031102lw/agentbench.git
cd agentbench
pip install -r requirements.txt

# 2. 配置环境变量
cp .env.example .env # 编辑 .env 填入 API Key

# 3. 启动服务
python -m uvicorn src.main:app --reload # 后端 API → localhost:8000
streamlit run frontend/app.py # 前端看板 → localhost:8501