多模态 AI 创作 · 💬 文本 🎨 图像 🎬 视频 👁️ 视觉理解
📖

使用指南 & 功能介绍

聚合多平台 AI 能力 · 文本对话 · 视觉理解 · 图像生成 · 视频生成

🚀 快速上手 5 分钟入门

🔑

1. 配置 API Key

点击右上角「API Key」按钮,填写各平台密钥。支持 Agnes、SiliconFlow、BigModel、Intern-AI。

推荐先配置 Agnes
🤖

2. 选择模型

在「模型选择」中切换不同平台和模型。文本、视觉、图像、视频各模式均有专属模型。

每个模式独立记忆
✍️

3. 输入提示词

在输入框描述你的需求。支持文字、图片(本地上传或 URL)、以及混合输入。

越具体效果越好
📁

4. 管理资产

所有生成的图片和视频自动保存到「我的资产」,支持预览、下载和删除。

数据持久化存储

🧩 功能模块详解

💬

文本对话

与 AI 进行多轮对话,支持历史记忆。可启用「Thinking 模式」让模型先推理再回答。

  • 支持模型:Agnes 2.0 Flash/Pro、Qwen、GLM、Intern 系列等
  • 特色:代码高亮、Markdown 渲染、对话历史本地存储
  • 技巧:使用 Shift+Enter 换行,Enter 发送
Agnes SiliconFlow BigModel Intern-AI
👁️

视觉理解

上传图片并提问,AI 会理解图像内容并回答你的问题。

  • 支持模型:GLM-4V-Flash、GLM-4.6V、InternVL3.5 系列
  • 支持:单图/多图上传、URL 图片
  • 适用场景:图像描述、物体识别、场景分析、OCR 识别
BigModel Intern-AI
🎨

图像生成

根据文字描述生成高质量图片,支持多种尺寸和宽高比。

  • 支持模型:Agnes Image 2.1 Flash、Kolors、CogView-3-Flash
  • 参数:尺寸(1K~4K)、宽高比(1:1 ~ 21:9)
  • 技巧:提供详细的风格、构图、色彩描述
Agnes SiliconFlow BigModel
🎬

视频生成

将文字或图片转化为动态视频,支持多种时长和比例。

  • 支持模型:Agnes Video V2.0、CogVideoX-Flash
  • 参数:时长(3~18s)、宽高比(16:9 / 9:16 / 1:1 等)
  • 注意:视频生成需要 1-3 分钟,系统会自动轮询
Agnes BigModel

🔌 平台与模型对照

平台 文本模型 视觉模型 图像模型 视频模型
🤖 Agnes agnes-2.0-flash / pro agnes-image-2.1-flash agnes-video-v2.0
🔮 SiliconFlow Qwen3.5-4B, GLM-Z1-9B, DeepSeek-R1-8B 等 Kolors
🏢 BigModel GLM-4.7-Flash, GLM-4.5-Air, GLM-4.7 GLM-4V-Flash, GLM-4.6V CogView-3-Flash CogVideoX-Flash
🤖 Intern-AI Intern-S1 / S2 系列 InternVL3.5 系列
💡 各平台模型持续更新,可在「模型选择」下拉中查看完整列表。

🖼️ 图片输入方式

📤

本地上传

点击「选择图片」或拖拽图片到上传区域。支持 JPG、PNG、WEBP,单张最大 10MB。

多图上传
🔗

URL 输入

在输入框中粘贴图片 URL(多个用逗号分隔),点击「添加」即可引用网络图片。

支持任意公开图片
📎

混合模式

可同时上传本地图片和 URL 图片,系统自动合并。视频生成仅使用第一张作为参考。

灵活组合

💡 高级技巧 & 常见问题

🧠
Thinking 模式(深度推理)
在文本对话中启用「Thinking 模式」,模型会先进行内部推理再给出回答。适合复杂问题、数学推理、逻辑分析等场景。响应时间会稍长,但回答质量更高。
快捷键速记
Enter 发送消息 · Shift+Enter 换行 · Ctrl+Enter 快速发送 · 双击状态栏清空对话历史
⚠️
视频生成常见问题
• 视频生成需要 1-3 分钟,请耐心等待,系统会自动轮询。
• 如果队列繁忙,会提示「视频队列已满」,请稍后重试(建议等待 2-3 分钟)。
• 提示词必须描述图片中的内容,否则 AI 无法识别图片元素。
🔑
API Key 管理
• 支持多平台 Key 独立配置,互不干扰。
• Key 保存在浏览器 Cookie 中(有效期 30 天),不会明文存储于服务器。
• 点击「重置为默认」可恢复使用内置默认 Key(部分模型有限流)。