课程对于图片和视频模型的总结:
图像生成模型排名综合能力,参考2026年主流评测Google Imagen 4(提示词遵循与细节最佳)
Midjourney V8(艺术性与审美领先)
OpenAI GPT image-2(复杂场景与文本渲染强)
Black Forest Labs FLUX 2(开源生态灵活,质量接近顶配)
字节跳动 Seedream 5.0 Pro(豆包/即梦使用,中文理解优)
阿里 Qwen-Image-3.0(文本与图表生成突出)
阿里 Z-Image(速度极快,开源)
智谱 GLM-Image(混合架构,文本渲染好)
腾讯 HunyuanImage-3.0(有轻量部署版本)
Google Gemini 3.5(全能型,但图像生成略逊于专用模型)
Stability AI Stable Diffusion 3.5(经典,硬件友好)
视频生成模型排名(综合能力,含控制性、一致性、分辨率):
Google Veo 3.1(角色一致性与物理逻辑最佳)
快手可灵 Kling 3.0(复杂动作与日常交互顶级,支持4K)
Runway Gen-4(专业摄像机控制,精细区域控制)
OpenAI Sora(知名度高,但实际评测稍逊于前两者)
Luma Dream Machine Ray3(关键帧插值突出,适合转场)
字节跳动 Seedance 2.0/2.5(国内常用,效果稳定)
Pika 2.0(短视频平台友好)
页:
[1]