PosterCraft:基于深度学习的高质量美学海报生成框架项目

[ICLR'26] Rethinking High-Quality Aesthetic Poster Generation in a Unified Framework

分支1Tags0
文件最后提交记录最后更新时间
1 年前
1 年前
6 个月前
1 年前
1 年前
1 年前
1 年前

🎨 PosterCraft:
在统一框架中重新思考高质量美学海报生成

arXiv GitHub HuggingFace Website Video HF Demo

PosterCraft Logo

🌐 官网 | 🎯 演示 | 📄 论文 | 🤗 模型 | 📚 数据集 | 🎥 视频 | 🤗 HF 演示


最新动态

  • 🔥 [2025.06] PosterCraft 已被 ICLR 2026 接收!
  • 📦 [2025.09] 我们已在 HuggingFace 上发布 Poster100K 数据集
  • 🖥️ [2025.06] 我们已将研究成果发布在 MeiGen-AI 平台,您不仅可以了解我们的项目,还能探索其他同事的研究工作。欢迎访问以获取更多见解和贡献机会。
  • 🧩 [2025.06] 社区用户 @AIFSH 已成功将 PosterCraft 集成到 ComfyUI 中!
    您可以在此查看完整工作流程:PosterCraft-ComfyUI 示例
    非常感谢这位贡献者——这将对众多用户有所帮助!详情请参见 Issue #6
  • 📖 [2025.06] 我们的 中文文章 现已发布,其中详细介绍了 PosterCraft 并提供了技术解析!
    阅读链接:中文解读|高质量美学海报生成框架 PosterCraft
  • 🔥 [2025.06] 我们已在 Hugging Face Space 部署演示,欢迎试用!
  • 🚀 [2025.06] 我们的 gradio 演示和推理代码现已开放!
  • 📊 [2025.06] 我们已在 HuggingFace 上发布部分数据集和模型权重。

看看这样是否可行!

👥 作者

Sixiang Chen1,2*, Jianyu Lai1*, Jialin Gao2*, Tian Ye1, Haoyu Chen1, Hengyu Shi2, Shitong Shao1, Yunlong Lin3, Song Fei1, Zhaohu Xing1, Yeying Jin4, Junfeng Luo2, Xiaoming Wei2, Lei Zhu1,5

1香港科技大学(广州)
2美团
3厦门大学
4新加坡国立大学
5香港科技大学

*共同第一作者,†通讯作者


🌟 什么是PosterCraft?

What is PosterCraft - Quick Prompt Demo

PosterCraft 是一个用于高质量美学海报生成的统一框架,在精准文本渲染抽象艺术无缝融合醒目布局设计以及风格协调性方面表现卓越。

🚀 快速开始

🔧 安装

# Clone the repository
git clone https://github.com/ephemeral182/PosterCraft.git
cd PosterCraft

# Create conda environment
conda create -n postercraft python=3.11
conda activate postercraft

# Install dependencies
pip install -r requirements.txt

🚀 快速生成

通过 BF16 精度,根据您的提示生成高质量的美观海报:

python inference.py \
  --prompt "Urban Canvas Street Art Expo poster with bold graffiti-style lettering and dynamic colorful splashes" \
  --enable_recap \
  --num_inference_steps 28 \
  --guidance_scale 3.5 \
  --seed 42 \
  --pipeline_path "black-forest-labs/FLUX.1-dev" \
  --custom_transformer_path "PosterCraft/PosterCraft-v1_RL" \
  --qwen_model_path "Qwen/Qwen3-8B"

如果您使用的 GPU 内存有限,可以使用 inference_offload.py 将部分组件卸载到 CPU 上:

python inference_offload.py \
  --prompt "Urban Canvas Street Art Expo poster with bold graffiti-style lettering and dynamic colorful splashes" \
  --enable_recap \
  --num_inference_steps 28 \
  --guidance_scale 3.5 \
  --seed 42 \
  --pipeline_path "black-forest-labs/FLUX.1-dev" \
  --custom_transformer_path "PosterCraft/PosterCraft-v1_RL" \
  --qwen_model_path "Qwen/Qwen3-8B"

💻 Gradio Web UI

我们为 PosterCraft 提供了一个 Gradio Web 用户界面。

python demo_gradio.py

📊 性能基准测试

📈 定量结果

方法 文本召回率 ↑ 文本 F1 分数 ↑ 文本准确率 ↑
OpenCOLE (Open) 0.082 0.076 0.061
Playground-v2.5 (Open) 0.157 0.146 0.132
SD3.5 (Open) 0.565 0.542 0.497
Flux1.dev (Open) 0.723 0.707 0.667
Ideogram-v2 (Close) 0.711 0.685 0.680
BAGEL (Open) 0.543 0.536 0.463
Gemini2.0-Flash-Gen (Close) 0.798 0.786 0.746
PosterCraft (ours) 0.787 0.774 0.735
用户研究结果

🎭 作品展示与示例

🎨 PosterCraft 作品展示


冒险旅行

后启示录

科幻 drama

太空惊悚

文化活动

奢侈品

演唱会

儿童书籍

电影海报

🏗️ 模型架构

PosterCraft Framework Overview
高质量美学海报生成的统一框架

我们的统一框架在训练流程中包含四个关键优化阶段

🔤 阶段一:文本渲染优化

通过在高质量背景上精确渲染多样化文本,解决文本生成的准确性问题,同时确保背景的忠实呈现,并为海报生成奠定基础保真度和稳健性。

🎨 阶段二:高质量海报微调

利用区域感知校准技术,将重点转向海报整体风格和文本-背景协调性。此微调阶段在保留文本准确性的同时,增强美学海报的艺术完整性。

🎯 阶段三:美学-文本强化学习

采用美学-文本偏好优化方法,以捕捉更高阶的美学权衡。这一强化学习阶段优先考虑满足整体美学标准的输出,并减轻字体渲染缺陷。

🔄 阶段四:视觉-语言反馈

引入联合视觉-语言条件机制。这种迭代反馈将视觉信息与针对性文本建议相结合,进行多模态修正,逐步优化美学内容和背景协调性。


💾 模型库

我们提供了在PosterCraft pipeline不同阶段微调的核心模型权重。

模型 阶段 描述 下载
🎯 PosterCraft-v1_RL 阶段三:美学-文本RL 通过美学-文本偏好优化进行优化,以实现更高阶的美学权衡。 🤗 HF
🔄 PosterCraft-v1_Reflect 阶段四:视觉-语言反馈 利用视觉-语言反馈进行迭代优化,以进一步提升协调性和内容准确性。 🤗 HF

📚 数据集

我们为 PosterCraft 工作流的训练提供了四个专用数据集

🔤 Text-Render-2M

Text-Render-2M Dataset
Text-Render-2M:多实例文本渲染与多样化选择

一个全面的文本渲染数据集,包含200 万高质量样本。具备多实例文本渲染能力,文本选择多样化(大小、数量、位置和旋转角度各不相同),并通过基于模板和随机字符串两种方式实现动态内容生成。

🎨 HQ-Poster-100K

HQ-Poster-100K Dataset
HQ-Poster-100K:精选高质量美学海报

10 万张经过精心筛选的高质量海报,采用先进的过滤技术和多模态评分。具备由 Gemini 驱动的蒙版生成功能,并配有详细说明文字,以实现对海报的全面理解。

👍 Poster-Preference-100K

Poster-Preference-100K Dataset
Poster-Preference-100K:用于美学优化的偏好学习对

该偏好数据集来源于超过10 万张生成的海报图像。通过 Gemini 和美学评估人员的综合评估,我们构建了高质量的偏好对,旨在通过强化学习使海报生成与人类的审美判断保持一致。

🔄 Poster-Reflect-120K

Poster-Reflect-120K Dataset
Poster-Reflect-120K:用于迭代优化的视觉-语言反馈对

该视觉-语言反馈数据集来源于超过12 万张生成的海报图像。通过 Gemini 和美学评估人员的综合评估,该数据集捕捉了迭代优化过程,并为进一步改进提供了详细反馈。

数据集 规模 描述 下载
🔤 Text-Render-2M 200 万样本 支持多实例的高质量文本渲染样本 🤗 HF
🎨 HQ-Poster-100K 10 万样本 经过精选的高质量海报,包含美学评估 🤗 HF
👍 Poster-Preference-100K 10 万张图像 用于强化学习训练的海报偏好对 🤗 HF
🔄 Poster-Reflect-120K 12 万张图像 用于迭代优化的视觉-语言反馈对 🤗 HF

📝 引用

如果您发现PosterCraft对您的研究有所帮助,请引用我们的论文:

@article{chen2025postercraft,
  title={PosterCraft: Rethinking High-Quality Aesthetic Poster Generation in a Unified Framework},
  author={Chen, Sixiang and Lai, Jianyu and Gao, Jialin and Ye, Tian and Chen, Haoyu and Shi, Hengyu and Shao, Shitong and Lin, Yunlong and Fei, Song and Xing, Zhaohu and Jin, Yeying and Luo, Junfeng and Wei, Xiaoming and Zhu, Lei},
  journal={arXiv preprint arXiv:2506.10741},
  year={2025}
}

🙏 致谢

  • 🏛️ 感谢我们所属机构提供的支持。
  • 🤝 特别感谢开源社区给予的启发。

📬 联系方式

如有任何问题或咨询,请联系我们:

  • Sixiang Chenschen691@connect.hkust-gz.edu.cn
  • Jianyu Laijlai218@connect.hkust-gz.edu.cn

项目介绍

在统一框架下对高质量审美海报生成的新思考【此简介由AI生成】

定制我的领域