Skip to content

Only 52 out of 56 tasks were successful. #17

Description

@WEYAI

2025-09-29 07:22:59,740 - benchmark.results_aggregator - WARNING - Skipping result without evaluation for task google_maps_000
2025-09-29 07:22:59,741 - benchmark.results_formatter - INFO -

2025-09-29 07:22:59,741 - benchmark.results_formatter - INFO - Cumulative Metrics for gpt-5 (mcpbench_tasks_single_runner_format.json) (52/56 tasks completed):
2025-09-29 07:22:59,741 - benchmark.results_formatter - INFO - ================================================================================
2025-09-29 07:22:59,741 - benchmark.results_formatter - INFO - LLM Judge Scores:
2025-09-29 07:22:59,741 - benchmark.results_formatter - INFO - • Task Completion Score: 8.436
2025-09-29 07:22:59,741 - benchmark.results_formatter - INFO - • Tool Selection Score: 8.673
2025-09-29 07:22:59,741 - benchmark.results_formatter - INFO - • Planning Effectiveness Score: 8.065
2025-09-29 07:22:59,741 - benchmark.results_formatter - INFO - Subdimension Scores:
2025-09-29 07:22:59,741 - benchmark.results_formatter - INFO - Task: Fulfillment 8.371, Grounding 8.501
2025-09-29 07:22:59,741 - benchmark.results_formatter - INFO - Tool: Appropriateness 8.877, Parameter Accuracy 8.469
2025-09-29 07:22:59,741 - benchmark.results_formatter - INFO - Plan: Dependency 8.388, Efficiency 7.743
2025-09-29 07:22:59,741 - benchmark.results_formatter - INFO - Tool Accuracy Metrics:
2025-09-29 07:22:59,741 - benchmark.results_formatter - INFO - • Input Schema Compliance: 99.68% (among valid tool names)
2025-09-29 07:22:59,741 - benchmark.results_formatter - INFO - • Valid Tool Name Rate: 100.00%
2025-09-29 07:22:59,741 - benchmark.results_formatter - INFO - • Tool Call Success Rate: 98.88%
2025-09-29 07:22:59,741 - benchmark.results_formatter - INFO - Execution Statistics:
2025-09-29 07:22:59,741 - benchmark.results_formatter - INFO - • Avg Rounds per Task: 7.36
2025-09-29 07:22:59,742 - benchmark.results_formatter - INFO - • Avg Tool Calls per Task: 59.84
2025-09-29 07:22:59,742 - benchmark.results_formatter - INFO - Token Usage (OpenAI Tokenizer):
2025-09-29 07:22:59,742 - benchmark.results_formatter - INFO - • Avg Output Tokens per Task: 37738
2025-09-29 07:22:59,742 - benchmark.results_formatter - INFO - • Avg Prompt Tokens per Task: 386392
2025-09-29 07:22:59,742 - benchmark.results_formatter - INFO - • Avg Total Tokens per Task: 424130
2025-09-29 07:22:59,742 - benchmark.results_formatter - INFO - Runtime:
2025-09-29 07:22:59,742 - benchmark.results_formatter - INFO - • Avg Agent Execution Time: 1328.5s
2025-09-29 07:22:59,742 - benchmark.results_formatter - INFO - • Avg Judge Pipeline Time: 74.4s
2025-09-29 07:22:59,742 - benchmark.results_formatter - INFO - ================================================================================

Model gpt-5: 100%|████████████████████████████████████████████████████████████████████████████████████████| 56/56 [37:09:06<00:00, 2388.33s/it]
2025-09-29 07:23:00,746 - benchmark.runner - INFO - Model gpt-5 completed: 52/56 tasks successful
2025-09-29 07:23:00,746 - benchmark.runner - INFO - MCP-Bench benchmark completed: 1 models tested
2025-09-29 07:23:00,781 - benchmark.runner - INFO - Results saved to benchmark_results_20250929_072300.json
2025-09-29 07:23:00,781 - benchmark.runner - INFO - The overall score is calculated as the average of four main dimensions: schema understanding, task completion, tool usage, and planning effectiveness. Within each dimension (e.g., schema understanding), we first compute the mean across its sub-dimensions.

Only 52 out of 56 tasks were successful. Will this affect the final result? If so, will it increase or decrease his score?

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions