图片生成
nova-d48w768-sdxl1024
BAAI该模型用于根据文本提示生成和修改图像。 非量化自回归扩散模型,支持文本到图像的生成与编辑。模型采用预训练文本编码器(Phi-2)和SDXL-VAE图像 tokenizer。 使用Hugging Face Diffusers库加载和运行模型。
闲社模型中心
用中文看懂模型能力、适用场景和运行条件,再通过国内镜像下载固定版本。
支持按模型名称、作者和用途查找
精选模型
图片生成
该模型用于根据文本提示生成和修改图像。 非量化自回归扩散模型,支持文本到图像的生成与编辑。模型采用预训练文本编码器(Phi-2)和SDXL-VAE图像 tokenizer。 使用Hugging Face Diffusers库加载和运行模型。
图片生成
这是一款基于文本提示生成和修改图像的模型。它是一款非量化视频自回归(NOVA)扩散模型,使用预训练的文本编码器(Phi-2)和一个VAE图像分词器(SD-VAE)。 该模型仅用于研究目的。可能的研究领域和任务包括: 艺术作品生成及设计与其它艺术创作流程中的应用。
图片生成
非量化自回归文本到图像生成模型,用于根据文本提示生成和修改图像。 基于文本提示生成图像,支持图像修改。采用预训练文本编码器(Phi-2)和VAE图像分词器(SDXL-VAE)。 使用🤗 Diffusers库加载和运行模型。
图片生成
精度:torch.float16 (FP16) 模型描述:这是一个基于文本提示生成和修改图像的模型。非量化视频自回归(NOVA)扩散模型,使用预训练文本编码器(Phi-2)和一个VAE图像分词器(SDXL-VAE)。 需要使用🤗 Diffusers库运行
图片生成
OmniGen是一个统一的图像生成模型,能够根据多模态提示生成各种图像。该模型设计简洁、灵活、易于使用,旨在简化图像生成流程,无需加载额外的网络模块或进行复杂的预处理步骤。 OmniGen可用于执行多种任务,包括但不限于:文本到图像生成、主体驱动生成、保持身份生成、图像编辑以及基于图像条件的生成。OmniGen无需额外的插件或操作,可根据文本提示自动识别输入图像中的特征,如所需物体、人体姿态、深度图等。 如遇内存不足,可设置offload model=True。当输入多张图像
图片生成
本模型用于根据文本提示生成和修改图像。 精度:torch.float16(FP16) 分词器:Emu3.5-Vision-Tokenizer
图片生成
本模型为文本到图像生成模型,可根据文本提示生成和修改图像。 基于文本提示生成图像,支持图像修改任务。模型参数规模为0.6B,支持1024x1024分辨率输出,采用FP16精度推理。模型基于Uniform Discrete Diffusion框架开发,使用Emu3.5-Vision-Tokenizer作为视觉分词器。 推理精度:torch.float16(FP16)
图片生成
模型系列: BAAI-Vision-URSA 模型分词器: Emu3.5-Vision-Tokenizer模型描述: 这是一个可以根据文本提示生成和修改图像的模型。 根据文本描述生成图像。对图像进行基于文本的修改。
图片生成
Qwen-Image-Edit-2511 图像编辑模型,是 Qwen-Image-Edit-2509 的增强版本。 提升角色一致性,可基于输入肖像进行创意编辑同时保持主体身份和视觉特征
图片生成
Qwen-Image-2512 是通义千问图像基础模型的 2025 年 12 月更新版,面向文本生成图片和图片编辑。 相比基础版 Qwen-Image,该版本重点改善人物面部与环境的真实感,增强风景、动物毛发等自然细节,并提高画面中文字的准确性、排版质量以及图文组合的还原度。 适合海报与视觉创作、人物和场景生成、带文字图片制作,以及基于输入图片进行修改和再创作。
登录闲社账号后即可提交收录建议。
模型及文件版权归原作者所有。链接检查不等于安全认证或运行验证,使用前请阅读原作者说明与许可。