1.8w 查看 · 2026-07-07 更新
工具列表
-
get_leaderboard: 获取 SLCT Arena 模型排行榜
查询各模型在评测中的综合排名和得分。
评分维度说明:
- overall(综合能力): 日常30% + 专业40% + 极限30% 加权平均
- daily(日常场景): 基础难度得分,适合普通用户日常使用
- professional(专业场景): 中等难度得分,适合专业工作需求
- extreme(极限场景): 困难难度得分,考验模型能力上限
Args: test_type: 测试类型筛选,可选值: - "xsct-vg": 图像生成能力 - "xsct-vu": 图像理解能力 - "xsct-l": 文本理解能力(默认) - "xsct-w": 网页生成能力 sort_by: 排序维度,可选值: - "overall": 综合能力(默认) - "daily": 日常场景(基础难度) - "professional": 专业场景(中等难度) - "extreme": 极限场景(困难难度) limit: 返回条数,默认 10,最多 30
Returns: 排行榜数据,包含排名、模型名称、各维度得分、详情页链接
-
get_model_scores: 获取模型在各维度的详细评分
了解某个模型在不同测试维度的表现,分析其强项和弱项。
Args: model_name: 模型名称,支持模糊匹配(如 "gemini"、"gpt-4o") test_type: 测试类型筛选,可选值: - "xsct-vg": 图像生成 - "xsct-vu": 图像理解 - "xsct-l": 文本理解 - "xsct-w": 网页理解 不填则返回所有类型
Returns: 模型在各维度的评分详情,包含基础/中等/困难难度得分、强项和弱项分析
-
compare_models: 对比两个模型在同一测试类型下的表现
并排展示两个模型在各维度的得分差异,帮助用户选择合适的模型。
Args: model_name_a: 第一个模型名称,支持模糊匹配 model_name_b: 第二个模型名称,支持模糊匹配 test_type: 对比的测试类型,必填。可选值: - "xsct-vg": 图像生成 - "xsct-vu": 图像理解 - "xsct-l": 文本理解(默认) - "xsct-w": 网页理解
Returns: 两个模型的维度对比表,包含各维度得分差异和胜负分析
-
search_testcases: 搜索测试用例
按关键词、类型、维度搜索测试用例,了解有哪些评测场景。 支持中文关键词智能匹配(如搜索"润色"会匹配到 L-Polish 维度)。
Args: query: 搜索关键词,匹配用例标题、描述和维度(如 "润色"、"数学"、"代码"、"光影") test_type: 类型筛选,可选值: - "xsct-vg": 图像生成 - "xsct-vu": 图像理解 - "xsct-l": 文本理解 - "xsct-w": 网页理解 dimension: 维度筛选(如 "L-Polish"、"L-Math"、"P-Lighting") limit: 返回条数,默认 10,最多 30
Returns: 匹配的测试用例列表,包含用例ID、标题、描述、类型、详情页链接
-
get_model_case_result: 获取模型在某测试用例的完整评测结果
返回模型生成的完整内容、多 Judge 评分详情、各维度得分等信息。 这是查看单个评测结果最详细的工具。
返回内容
- 模型生成结果: 完整的生成内容(文本)或图片查看链接(图像)
- 综合评分: 最终得分(多 Judge 加权平均)
- 各 Judge 评分: 每个评分模型的独立打分(如 Claude、Gemini、GPT)
- 维度得分: 各评测维度的细项分数
- 评分理由: AI 给出的详细评分依据
- 性能数据: 生成耗时、Token 消耗、费用等
评分公式
- 多 Judge 模式:最终得分 = 各 Judge 得分的加权平均(去除最高最低后取平均,或直接平均)
- 单 Judge 模式:最终得分 = 该 Judge 的评分
Args: model_name: 模型名称,支持模糊匹配 test_id: 测试用例 ID(从 search_testcases 结果获取) difficulty: 难度筛选,可选值: - "basic": 基础难度 - "medium": 中等难度 - "hard": 困难难度 不填则返回所有难度
Returns: 完整评测结果,包含生成内容、多 Judge 评分、维度得分、评分理由等
-
get_dimensions: 获取所有评测维度列表
查看平台支持的评测维度,了解每个维度包含多少测试用例。 这些维度可用于 search_testcases 的 dimension 参数进行精确筛选。
Args: test_type: 测试类型筛选,可选值: - "xsct-vg": 图像生成 - "xsct-vu": 图像理解 - "xsct-l": 文本理解 - "xsct-w": 网页生成 不填则返回所有类型的维度
Returns: 各测试类型下的维度列表,包含维度名称、用例数量、示例用例
-
calculate_cost: 计算模型使用成本(支持多模型横向对比)
根据各类用量计算使用模型的费用,支持 7 个计费维度和多模型对比。 这是一个强大的成本测算工具,可帮助用户选择最具性价比的模型。
计费维度说明
-
输入 Tokens (input_tokens)
- 每次请求发送给模型的文字内容(Prompt)消耗的 token 数
- 包含系统提示词 (system prompt) 和用户消息 (user message)
- 典型值:简单对话 500-2K,复杂任务 5K-20K,长文档 50K-200K
-
输出 Tokens (output_tokens)
- 模型生成的回复内容消耗的 token 数
- 通常比输入少,但单价更高(约 2-4 倍)
- 典型值:简短回答 100-500,详细回答 1K-5K,长文生成 5K-50K
-
缓存读 Tokens (cache_read_tokens)
- 复用已缓存的提示词内容(如固定系统提示),价格约为正常输入的 1/10
- 适用于:相同 system prompt 的多轮对话、批量处理任务
- 主要支持:Claude 系列、部分国产模型
- 典型场景:10K 系统提示 × 1000 次调用 = 10M 缓存读
-
缓存写 Tokens (cache_write_tokens)
- 首次将提示词写入缓存的额外费用,通常比正常输入略贵
- 写一次、后续多次读取,长期使用可节省大量成本
- 一般只需设置一次(首次调用)
-
推理 Tokens (reasoning_tokens)
- 思考型模型(o1、o3、DeepSeek-R1 等)在正式回答前的内部推理过程
- 不展示给用户但会计费,价格通常与输出相近
- 典型值:简单问题 1K-5K,复杂推理 10K-100K
-
图像数量 (image_count)
- 图像生成模型按张计费(如 DALL·E、豆包 Seedream)
- 价格因分辨率和模型而异,从 ¥0.02/张 到 ¥0.5/张 不等
- 注意:部分图像模型(如 Gemini)按 token 计费而非按张
-
搜索次数 (search_count)
- 部分模型支持联网搜索功能,每次搜索额外计费
- 如 Perplexity、带搜索插件的 GPT 等
调用次数 (call_count)
业务每天/每月发起的 API 请求次数。所有用量 × 调用次数 = 实际总费用。 例如:单次用量 10K input + 2K output,每天调用 1000 次,则月费用 = 单次费用 × 1000 × 30
Args: model_names: 模型名称,支持多个模型用逗号分隔进行对比(如 "gpt-4o, claude-sonnet, gemini"),模型名称与榜单一致。 input_tokens: 单次输入 token 数(默认 0) output_tokens: 单次输出 token 数(默认 0) cache_read_tokens: 单次缓存读取 token 数(默认 0,仅部分模型支持) cache_write_tokens: 单次缓存写入 token 数(默认 0,仅部分模型支持) reasoning_tokens: 单次推理 token 数(默认 0,仅思考型模型) image_count: 单次生成图片数(默认 0,图像生成模型使用) search_count: 单次搜索次数(默认 0,仅支持联网搜索的模型) call_count: 调用次数,默认 1(可设置为日/月调用量进行批量估算)
Returns: 费用计算结果,多模型时会显示对比表格和性价比分析
-
-
get_testcase_curl: 获取测试用例的 curl 命令
返回可以直接用于测试大模型的 curl 命令,包含完整的 prompt。 你可以复制这个命令,替换 API Key 后直接运行测试。
Args: test_id: 测试用例 ID(从 search_testcases 获取) difficulty: 难度级别,可选值: - "basic": 基础难度(默认) - "medium": 中等难度 - "hard": 困难难度 provider: API 提供商,可选值: - "openrouter": OpenRouter(默认,支持多种模型) - "openai": OpenAI 官方 - "dashscope": 阿里云通义
Returns: 完整的 curl 命令,可直接用于测试模型
服务配置
[{'mcpServers': {'xsct-bench': {'url': 'https://xsct.ai/mcp'}}}]
来源
- 来源:ModelScope
- 链接:https://xsct.ai/