X

XSCT 模型选型 MCP

developer-tools

1.8w 查看 · 2026-07-07 更新

工具列表

  • get_leaderboard: 获取 SLCT Arena 模型排行榜

    查询各模型在评测中的综合排名和得分。

    评分维度说明:

    • overall(综合能力): 日常30% + 专业40% + 极限30% 加权平均
    • daily(日常场景): 基础难度得分,适合普通用户日常使用
    • professional(专业场景): 中等难度得分,适合专业工作需求
    • extreme(极限场景): 困难难度得分,考验模型能力上限

    Args: test_type: 测试类型筛选,可选值: - "xsct-vg": 图像生成能力 - "xsct-vu": 图像理解能力 - "xsct-l": 文本理解能力(默认) - "xsct-w": 网页生成能力 sort_by: 排序维度,可选值: - "overall": 综合能力(默认) - "daily": 日常场景(基础难度) - "professional": 专业场景(中等难度) - "extreme": 极限场景(困难难度) limit: 返回条数,默认 10,最多 30

    Returns: 排行榜数据,包含排名、模型名称、各维度得分、详情页链接

  • get_model_scores: 获取模型在各维度的详细评分

    了解某个模型在不同测试维度的表现,分析其强项和弱项。

    Args: model_name: 模型名称,支持模糊匹配(如 "gemini"、"gpt-4o") test_type: 测试类型筛选,可选值: - "xsct-vg": 图像生成 - "xsct-vu": 图像理解 - "xsct-l": 文本理解 - "xsct-w": 网页理解 不填则返回所有类型

    Returns: 模型在各维度的评分详情,包含基础/中等/困难难度得分、强项和弱项分析

  • compare_models: 对比两个模型在同一测试类型下的表现

    并排展示两个模型在各维度的得分差异,帮助用户选择合适的模型。

    Args: model_name_a: 第一个模型名称,支持模糊匹配 model_name_b: 第二个模型名称,支持模糊匹配 test_type: 对比的测试类型,必填。可选值: - "xsct-vg": 图像生成 - "xsct-vu": 图像理解 - "xsct-l": 文本理解(默认) - "xsct-w": 网页理解

    Returns: 两个模型的维度对比表,包含各维度得分差异和胜负分析

  • search_testcases: 搜索测试用例

    按关键词、类型、维度搜索测试用例,了解有哪些评测场景。 支持中文关键词智能匹配(如搜索"润色"会匹配到 L-Polish 维度)。

    Args: query: 搜索关键词,匹配用例标题、描述和维度(如 "润色"、"数学"、"代码"、"光影") test_type: 类型筛选,可选值: - "xsct-vg": 图像生成 - "xsct-vu": 图像理解 - "xsct-l": 文本理解 - "xsct-w": 网页理解 dimension: 维度筛选(如 "L-Polish"、"L-Math"、"P-Lighting") limit: 返回条数,默认 10,最多 30

    Returns: 匹配的测试用例列表,包含用例ID、标题、描述、类型、详情页链接

  • get_model_case_result: 获取模型在某测试用例的完整评测结果

    返回模型生成的完整内容、多 Judge 评分详情、各维度得分等信息。 这是查看单个评测结果最详细的工具。

    返回内容

    1. 模型生成结果: 完整的生成内容(文本)或图片查看链接(图像)
    2. 综合评分: 最终得分(多 Judge 加权平均)
    3. 各 Judge 评分: 每个评分模型的独立打分(如 Claude、Gemini、GPT)
    4. 维度得分: 各评测维度的细项分数
    5. 评分理由: AI 给出的详细评分依据
    6. 性能数据: 生成耗时、Token 消耗、费用等

    评分公式

    • 多 Judge 模式:最终得分 = 各 Judge 得分的加权平均(去除最高最低后取平均,或直接平均)
    • 单 Judge 模式:最终得分 = 该 Judge 的评分

    Args: model_name: 模型名称,支持模糊匹配 test_id: 测试用例 ID(从 search_testcases 结果获取) difficulty: 难度筛选,可选值: - "basic": 基础难度 - "medium": 中等难度 - "hard": 困难难度 不填则返回所有难度

    Returns: 完整评测结果,包含生成内容、多 Judge 评分、维度得分、评分理由等

  • get_dimensions: 获取所有评测维度列表

    查看平台支持的评测维度,了解每个维度包含多少测试用例。 这些维度可用于 search_testcases 的 dimension 参数进行精确筛选。

    Args: test_type: 测试类型筛选,可选值: - "xsct-vg": 图像生成 - "xsct-vu": 图像理解 - "xsct-l": 文本理解 - "xsct-w": 网页生成 不填则返回所有类型的维度

    Returns: 各测试类型下的维度列表,包含维度名称、用例数量、示例用例

  • calculate_cost: 计算模型使用成本(支持多模型横向对比)

    根据各类用量计算使用模型的费用,支持 7 个计费维度和多模型对比。 这是一个强大的成本测算工具,可帮助用户选择最具性价比的模型。

    计费维度说明

    1. 输入 Tokens (input_tokens)

      • 每次请求发送给模型的文字内容(Prompt)消耗的 token 数
      • 包含系统提示词 (system prompt) 和用户消息 (user message)
      • 典型值:简单对话 500-2K,复杂任务 5K-20K,长文档 50K-200K
    2. 输出 Tokens (output_tokens)

      • 模型生成的回复内容消耗的 token 数
      • 通常比输入少,但单价更高(约 2-4 倍)
      • 典型值:简短回答 100-500,详细回答 1K-5K,长文生成 5K-50K
    3. 缓存读 Tokens (cache_read_tokens)

      • 复用已缓存的提示词内容(如固定系统提示),价格约为正常输入的 1/10
      • 适用于:相同 system prompt 的多轮对话、批量处理任务
      • 主要支持:Claude 系列、部分国产模型
      • 典型场景:10K 系统提示 × 1000 次调用 = 10M 缓存读
    4. 缓存写 Tokens (cache_write_tokens)

      • 首次将提示词写入缓存的额外费用,通常比正常输入略贵
      • 写一次、后续多次读取,长期使用可节省大量成本
      • 一般只需设置一次(首次调用)
    5. 推理 Tokens (reasoning_tokens)

      • 思考型模型(o1、o3、DeepSeek-R1 等)在正式回答前的内部推理过程
      • 不展示给用户但会计费,价格通常与输出相近
      • 典型值:简单问题 1K-5K,复杂推理 10K-100K
    6. 图像数量 (image_count)

      • 图像生成模型按张计费(如 DALL·E、豆包 Seedream)
      • 价格因分辨率和模型而异,从 ¥0.02/张 到 ¥0.5/张 不等
      • 注意:部分图像模型(如 Gemini)按 token 计费而非按张
    7. 搜索次数 (search_count)

      • 部分模型支持联网搜索功能,每次搜索额外计费
      • 如 Perplexity、带搜索插件的 GPT 等

    调用次数 (call_count)

    业务每天/每月发起的 API 请求次数。所有用量 × 调用次数 = 实际总费用。 例如:单次用量 10K input + 2K output,每天调用 1000 次,则月费用 = 单次费用 × 1000 × 30

    Args: model_names: 模型名称,支持多个模型用逗号分隔进行对比(如 "gpt-4o, claude-sonnet, gemini"),模型名称与榜单一致。 input_tokens: 单次输入 token 数(默认 0) output_tokens: 单次输出 token 数(默认 0) cache_read_tokens: 单次缓存读取 token 数(默认 0,仅部分模型支持) cache_write_tokens: 单次缓存写入 token 数(默认 0,仅部分模型支持) reasoning_tokens: 单次推理 token 数(默认 0,仅思考型模型) image_count: 单次生成图片数(默认 0,图像生成模型使用) search_count: 单次搜索次数(默认 0,仅支持联网搜索的模型) call_count: 调用次数,默认 1(可设置为日/月调用量进行批量估算)

    Returns: 费用计算结果,多模型时会显示对比表格和性价比分析

  • get_testcase_curl: 获取测试用例的 curl 命令

    返回可以直接用于测试大模型的 curl 命令,包含完整的 prompt。 你可以复制这个命令,替换 API Key 后直接运行测试。

    Args: test_id: 测试用例 ID(从 search_testcases 获取) difficulty: 难度级别,可选值: - "basic": 基础难度(默认) - "medium": 中等难度 - "hard": 困难难度 provider: API 提供商,可选值: - "openrouter": OpenRouter(默认,支持多种模型) - "openai": OpenAI 官方 - "dashscope": 阿里云通义

    Returns: 完整的 curl 命令,可直接用于测试模型

服务配置

[{'mcpServers': {'xsct-bench': {'url': 'https://xsct.ai/mcp'}}}]

来源