跳转至

Lab 5: Gemma4 端到端推理优化

Grapesea

参考资料:

GPTQ权重优化

首先学习一下原理:

Gemma 4 12B是一个“没有采用 encoder” 的小模型,实际上这指的是,在多模态情境下不使用encoder也获得了多模态理解和推理的能力.

端到端推理性能优化