Google Gemini 擅长什么
- 对话与文本生成:直接在 ComfyUI 工作流中与 Google 的多模态 AI 对话
- 多模态推理:利用 Gemini 的推理能力解读图像
- 图像到提示词的解读:官方模板附带一个提示词,可将您的图像转换为相应的绘画提示词
- 多图像输入:使用
Batch Images在单次运行中发送多张图像供 AI 解读
Google Gemini
体验 Google 的多模态 AI,借助 Gemini 的推理能力。在 Comfy Cloud 上运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON,或在模板库中搜索”Google Gemini”
LoadImage 节点:
example.png
LoadImage 节点 2 · example.png逐步完成工作流执行
在对应的模板中,我们构建了一个用于分析和生成角色提示词的提示词,可将你的图像解读为相应的绘图提示词
- 在
Load Image节点中,加载你需要 AI 解读的图像 - (可选)如有需要,你可以修改
Google Gemini中的提示词,让 AI 执行特定任务 - 点击
Run按钮,或使用快捷键Ctrl(cmd) + Enter执行对话 - 等待 API 返回结果之后,你可以在
Preview Any节点中查看 AI 返回的内容
补充说明
- 目前,文件输入节点
Gemini 输入文件需要先将文件上传到ComfyUI/input/目录中。此节点正在改进中,我们将在更新后修改模板 - 该工作流提供了一个使用
批量图像作为输入的示例。如果您有多张需要 AI 解读的图像,可以参考步骤示意图,并使用右键点击将对应节点模式设置为Always以启用它