Gemma 12B 多模态实测:看图很稳,听中文却像在猜谜
刚测了一下新发布的 Gemma 12B dense 多模态能力。
结果很有戏剧性:
- 图片识别:表现不错
- 英语语音:准确、速度快
- 日语语音:准确度很好,速度稍慢
- 中文语音:问题明显,输出经常驴唇不对马嘴🤣
如果你打算把它放进本地 AI 助手,尤其是语音交互场景,这份测试结果值得参考。
测试环境
这次使用的配置如下:
- 模型:Gemma 12B dense
- 运行框架:mlx-vlm
- 硬件:M5 Max,128GB 内存的 MacBook Pro
- 额外组件:官方提供的 drafter
- 图片测试入口:OpenClaw
- 音频测试方式:麦克风实时录音脚本
这里的 drafter 可以理解成辅助生成组件。它会参与推理过程,帮助模型更快地产出结果。实际运行时,除了加载 12B 主模型,还需要把官方配套的 drafter 一起载入。
图片识别:放进 OpenClaw 后表现不错
图片测试是在 OpenClaw 里完成的。
整体观感比较稳。图片发进去后,模型能够正常理解画面内容,响应也没有明显卡顿。日常拿来做图片问答、截图分析、简单 OCR 或视觉描述,已经具备一定实用性。
适合测试的场景包括:
- 识别桌面截图里的文字
- 描述一张照片中的人物和物体
- 分析网页或软件界面
- 根据图片回答简单问题
- 对比两张图片的差异
当然,这只是一次快速体验,不代表复杂图片、低清图片和专业图表都能稳定处理。要是你准备把它用于生产环境,还是得补一轮系统测试。
音频测试:OpenClaw 目前没法直接转发音频
音频部分遇到一个现实问题:OpenClaw 当前不会把 audio 直接发送给 LLM。
所以没法像发图片那样,直接丢一段录音进去测试。
这次采用了更直接的方案:
- 用麦克风录音
- 通过脚本读取音频
- 把音频交给本地模型处理
- 观察识别速度和文本准确度
这个方案比较适合快速验证模型能力。你不需要先搭完整的语音助手,也能知道模型到底能不能听懂人话。
英语语音:准确度和速度都在线
英语表现相当不错。
日常对话里的常见表达,模型基本都能准确识别。响应速度也很快,几乎是说完没多久就能拿到结果。
适合用来测试:
- 英语口语转文字
- 英语会议速记
- 英语视频字幕生成
- 英语语音指令
- 简单的英文问答
如果你的主要使用语言是英语,这个模型的本地语音能力值得试试。
日语语音:准确度好,速度略慢
日语也交出了不错的成绩。
准确度基本在线,日常表达没有遇到特别离谱的问题。响应速度比英语慢一点,但整体仍然接近实时,使用时不会让人一直盯着进度条发呆。
对日语学习、字幕整理、简单语音记录来说,已经有一定可用性。
中文语音:目前最明显的短板
中文测试就比较惨了。
模型不是单纯的“偶尔听错几个字”,而是会出现整句话语义跑偏的情况。你明明说的是一句正常中文,模型输出却像从几个完全不相关的词里随机抽签。
这种问题会直接影响实际使用:
- 语音指令容易执行错误
- 会议记录很难直接使用
- 中文聊天体验不稳定
- 方言、口音和快语速场景更需要谨慎
所以,别因为英语和日语表现不错,就默认中文也同样可靠。多语言模型最容易踩的坑,就是看起来“什么都支持”,实际各语言之间差距很大。
为什么要单独写脚本测试音频?
原因很简单:工具链还没有完全打通。
OpenClaw 可以方便地发送图片,但音频暂时不能直接传给 LLM。你要测麦克风输入,就得自己补一层处理逻辑。
一个可行的本地测试流程是:
麦克风录音
↓
保存为音频文件或音频流
↓
脚本读取音频
↓
mlx-vlm 加载 Gemma 12B 和 drafter
↓
输出识别文本
这样做的好处是定位问题更清楚:
- 是模型没听懂?
- 是音频格式不兼容?
- 是采样率有问题?
- 还是 OpenClaw 的传输链路没接好?
别一上来就把所有组件串在一起。出了问题以后,你会连锅都不知道该甩给谁。
没有 GUI?那就自己补一个后台
mlx-vlm 本身没有图形界面。
跑模型时,如果没有额外监控页面,你通常只能盯着终端,看加载、推理和输出日志。能用,但不太舒服。尤其是测试图片、音频和多个请求时,终端很快就会变成一锅粥。
这次让 CC 做了一个后台页面,用来查看模型运行情况。
后台可以帮助观察:
- 模型是否已经加载完成
- 当前有没有正在处理的请求
- 推理速度是否稳定
- 图片或音频输入有没有成功到达
- 输出是否出现异常
这类小工具看起来不起眼,实际很省时间。模型一旦跑起来,监控页面比翻终端日志直观多了。
一次测试能说明什么?
这次结果可以得出几个比较实际的判断:
- 视觉能力值得继续测试:图片识别表现不错,适合做本地视觉问答的起点。
- 英语语音已经比较实用:速度快,准确度也能满足不少日常任务。
- 日语表现有竞争力:速度稍慢,但准确度不错。
- 中文语音暂时不要盲目上线:尤其是涉及指令执行、会议记录和自动化操作的场景。
- M5 Max 128GB 能提供不错的本地运行条件:配合 mlx-vlm 和 drafter,整体响应速度很快。
- 工具链仍需要自己补齐:OpenClaw 的音频链路、mlx-vlm 的 GUI 和运行监控,都可能需要额外开发。
你也想复现?按这份清单准备
环境准备
- 一台支持 MLX 的 Apple Silicon Mac
- 足够的统一内存
- Gemma 12B 模型文件
- mlx-vlm 运行环境
- 官方配套 drafter
- 麦克风录音脚本
- 用于查看状态的后台页面或日志监控工具
测试顺序
建议按这个顺序来,排错会轻松很多:
- 只测文本输入,确认模型能正常加载。
- 加入图片,测试视觉理解和响应速度。
- 用英语音频测试录音、转码和推理链路。
- 换成日语,观察多语言表现。
- 再测中文,单独记录错字、漏词和语义偏差。
- 把所有组件接入 OpenClaw,检查完整流程。
记录这些指标
别只凭“感觉还不错”下结论。至少记录:
- 首次响应时间
- 完整输出耗时
- 识别准确率
- 长音频是否变慢
- 连续请求是否稳定
- 不同语言之间的表现差距
- 内存占用和模型加载时间
避坑清单
- 别把图片能力当成语音能力:多模态模型各模块表现可能差很多。
- 别只测试英文:英文跑得好,不代表中文也能用。
- 别忽略音频格式:采样率、声道和编码方式都可能影响结果。
- 别一开始就接 OpenClaw 全链路:先单独确认模型和脚本没问题。
- 别只盯终端输出:需要长时间运行时,最好加一个简单后台。
- 别直接把中文语音接到自动化指令上:识别错误可能会触发错误操作。
- 别把一次快测当成完整评测:想用于正式项目,还需要更多音色、口音、噪声和长音频测试。
结论
Gemma 12B dense 这次给人的感觉很明确:
图片能力不错,英语和日语语音值得玩,中文语音还需要继续打磨。
在 M5 Max 128GB 的 MacBook Pro 上,配合 mlx-vlm 和官方 drafter,运行速度相当亮眼。它已经适合拿来做本地多模态实验,也适合搭一个能看图、听英语和听日语的个人助手。
中文场景先别太激动。
你说一句,它回一句听不懂的话,这种助手可就不是“智能”了,是在和你玩猜谜游戏。