G

google/gemma-4-31B-it

图像文本转文本openai_privacy_filterTransformers.jsSafetensorsONNXLicense: apache-2.0

26,073下载 · 230.17GB · 2026-04-19更新

Gemma 是由 Google DeepMind 开发的一系列开源模型。Gemma 4 模型是多模态的,可以处理文本和图像输入(小型模型还支持音频),并生成文本输出。此版本包含预训练和指令调优两种版本的开源权重模型。Gemma 4 的上下文窗口最大可达 256K 个 token,并支持超过 140 种语言。

Gemma 4 融合了密集型和混合专家 (MoE) 架构,非常适合文本生成、编码和推理等任务。该模型提供四种不同规模:E2B、E4B、26B、A4B和31B。多样化的规模使其能够部署在从高端手机到笔记本电脑和服务器等各种环境中,从而普及了最先进的人工智能技术。

Gemma 4 引入了关键功能和架构方面的改进:

  • 推理能力——该系列所有型号均被设计为具有高度推理能力的智能体,并具有可配置的思维模式。
  • 扩展多模态——处理文本、支持可变纵横比和分辨率的图像(所有型号)、视频和音频(E2B 和 E4B 型号原生支持)。
  • 多样化和高效的架构——提供不同规模的密集型和混合专家 (MoE) 变体,以实现可扩展部署。
  • 针对设备端优化——较小型号专为在笔记本电脑和移动设备上高效本地执行而设计。
  • 增大上下文窗口——小型机型具有 128K 上下文窗口,而中型机型支持 256K 上下文窗口。
  • 增强编码和代理能力——在编码基准测试中取得了显著改进,同时还支持原生函数调用,从而为功能强大的自主代理提供支持。
  • 原生系统提示支持——Gemma 4 引入了对该system角色的原生支持,从而能够进行更结构化和可控的对话。

Gemma 4 系列模型旨在提供各尺寸级别下的前沿性能,目标部署场景涵盖移动和边缘设备(E2B、E4B)到消费级 GPU 和工作站(26B A4B、31B)。它们非常适合推理、智能体工作流、编码和多模态理解。

这些模型采用了一种混合注意力机制,将局部滑动窗口注意力与完全全局注意力交错使用,确保最后一层始终是全局的。这种混合设计在保证模型处理速度和内存占用低的轻量级特性的同时,也兼顾了处理复杂、长上下文任务所需的深度感知能力。为了优化长上下文任务的内存使用,全局层采用了统一的键值对,并应用了比例RoPE(p-RoPE)算法。