| """ |
| HelloAgents 智能体评估模块 |
| |
| 本模块提供了完整的智能体评估框架,包括: |
| - BFCL (Berkeley Function Calling Leaderboard): 工具调用能力评估 |
| - GAIA (General AI Assistants): 通用AI助手能力评估 |
| - Data Generation: 数据生成质量评估(LLM Judge & Win Rate) |
| |
| 主要组件: |
| - benchmarks: 各种评估基准测试 |
| - bfcl: BFCL评估(包含专用metrics) |
| - gaia: GAIA评估(包含专用metrics) |
| - data_generation: 数据生成质量评估 |
| |
| 使用示例: |
| >>> from hello_agents.evaluation import BFCLDataset, BFCLEvaluator |
| >>> from hello_agents import SimpleAgent |
| >>> |
| >>> agent = SimpleAgent(name="TestAgent") |
| >>> dataset = BFCLDataset(category="simple_python") |
| >>> evaluator = BFCLEvaluator(dataset=dataset) |
| >>> results = evaluator.evaluate(agent, max_samples=5) |
| >>> print(f"准确率: {results['overall_accuracy']:.2%}") |
| """ |
|
|
| |
| from helloAgents.evaluation.benchmarks.bfcl.dataset import BFCLDataset |
| from helloAgents.evaluation.benchmarks.bfcl.evaluator import BFCLEvaluator |
| from helloAgents.evaluation.benchmarks.gaia.dataset import GAIADataset |
| from helloAgents.evaluation.benchmarks.gaia.evaluator import GAIAEvaluator |
| from helloAgents.evaluation.benchmarks.data_generation.dataset import AIDataset |
| from helloAgents.evaluation.benchmarks.data_generation.llm_judge import LLMJudgeEvaluator |
| from helloAgents.evaluation.benchmarks.data_generation.win_rate import WinRateEvaluator |
|
|
| __version__ = "0.1.0" |
|
|
| __all__ = [ |
| |
| "BFCLDataset", |
| "GAIADataset", |
| "AIDataset", |
|
|
| |
| "BFCLEvaluator", |
| "GAIAEvaluator", |
| "LLMJudgeEvaluator", |
| "WinRateEvaluator", |
| ] |
|
|
|
|