nano banana资讯

NANO-Banana 开源图像生成工具介绍

大家好,我是马之仁。前段时间,谷歌发布了新模型,集梦也推出了 4.0 版本,支持编辑功能与想象力扩展。今天我们介绍的这个更新同样非常特别——它是一套开源的图像生成工具,目前分为两个主要用途:

  • 多角度一致性生成:延续此前能力,保持角色在不同视角下高度一致,效果依然强大。仅做了少量微调,整体表现稳定。
  • Open Banana(暂命名):新增功能模块,支持基于主角进行创意发散,例如输入“坐在摩托车上的角色”,模型即可生成符合语境的混搭风格图像。

该工具对输入图像的分辨率有一定要求,推荐使用 1920×1080 的图片。分辨率越高,推理准确性越强;但过高的分辨率可能导致显存溢出或推理中断,因此 1920×1080 是兼顾效果与效率的较优选择。输出尺寸支持 1920×1080 或 1280×720,后者推理速度更快,平均耗时几十秒至一分钟不等。

核心参数说明如下:

  • 主体权重:影响模型对主角特征的理解程度。值过高可能导致画面崩坏或角色失真,建议默认设为 0.3~0.4。
  • 挂载风格:因当前训练样本有限,预留了风格挂载接口,允许用户通过 Context 训练额外风格模型并加载,以拓展生成效果。此设计契合开源社区协作理念。
  • 另一个角度:用于多人镜头中切换机位,支持直接输入关键词或上传图像后由模型自动寻找新视角,需多次抽卡提升命中率。
  • 手部特写:专为镜头调度训练,可控制角色手部位置,但受限于样本数量,仍需抽卡尝试。

目前已重点训练若干提示词,包括“广告设计”和“正盘打”(用于镜头切换),并在实践中验证其有效性。此外,团队还单独训练了若干提升图像质量的专用提示词,但由于训练样本规模限制,实际增益未达预期,这也是本次版本的主要遗憾之一。

当前模型已具备以下基础能力:

  • 在固定主角前提下实现场景迁移;
  • 支持广告设计、多角色构图等二阶功能;
  • 可在单图基础上调度多个镜头角度;
  • 多角色一致性表现优异——即使画面中出现六个角色,仍能保持高度统一,目前尚未发现其他同类开源模型达到同等水平。

后续发展方向将聚焦两点:

  1. 扩大训练样本规模,计划联合开源社区共同收集与标注高质量样本;
  2. 探索引入千问(Qwen)作为文本理解模块,利用其中文编辑能力与更丰富的参数空间,进一步增强上下文理解与可控生成能力。

该模型已发布于 Hugging Face,搜索作者“马志源 2025”即可找到最新版本。感谢参与开发的各位同事:W、I、Y、OK 等伙伴在训练过程中提供的支持与协助。