Awesome-Text-to-Image:基于文本-图像技术的资源集合项目

(ෆ`꒳´ෆ) A Survey on Text-to-Image Generation/Synthesis.

Branch3Tags0
FilesLast commitLast update
2 months ago
3 years ago
5 years ago
6 months ago
3 years ago
3 years ago

𝓐𝔀𝓮𝓼𝓸𝓶𝓮 𝓣𝓮𝔁𝓽📝-𝓽𝓸-𝓘𝓶𝓪𝓰𝓮🌇

GitHub stars GitHub forks GitHub activity GitHub issues GitHub closed issues

Awesome Hits

文本到图像生成/编辑任务的资源合集。

⭐ 引用

如果您觉得本论文和代码仓库对您的研究有所帮助,请按以下方式引用:


@inproceedings{zhou2023vision+,
  title={Vision+ Language Applications: A Survey},
  author={Zhou, Yutong and Shimada, Nobutaka},
  booktitle={Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition},
  pages={826--842},
  year={2023}
}

🎑 新闻

Tip

1.0 版本(全能版)可在 此处 找到,并将于 24/02/29 停止更新

  • [24/02/29] 更新 《Awesome Text to Image》2.0 版本论文与代码其他相关工作 也将在 3 月逐步更新。
  • [23/05/26] 🔥 添加我们的综述论文《视觉 + 语言应用:综述》以及一个特别的 精选集 列表!
  • [23/04/04] 《视觉 + 语言应用:综述》被 CVPRW2023 接收。
  • [20/10/13] Awesome-Text-to-Image 仓库创建。

待办事项

目录

描述

  • 在过去几十年中,计算机视觉(CV)和自然语言处理(NLP)领域在深度学习研究方面取得了多项重大技术突破。近年来,研究人员开始关注如何将这些传统上相互独立领域中的语义信息与视觉信息进行融合。目前已有多项研究致力于文本到图像合成技术,该技术可将输入的文本描述(关键词或句子)转换为逼真的图像。

  • 此处提供了文本到图像任务相关的论文、代码和数据集。

🐌 Markdown 格式: *(会议/期刊 年份)标题,第一作者 等 [论文] [代码] [项目]

带代码的论文

  • 文本到人脸👨🏻🧒👧🏼🧓🏽 *(ECCV 2024)PreciseControl: Enhancing Text-To-Image Diffusion Models with Fine-Grained Attribute Control,Rishubh Parihar 等 [论文] [项目] *(arXiv 预印本 2024)[💬 数据集] 15M Multimodal Facial Image-Text Dataset,Dawei Dai 等 [论文] *(arXiv 预印本 2024)[💬 3D] Portrait3D: Text-Guided High-Quality 3D Portrait Generation Using Pyramid Representation and GANs Prior,Yiqian Wu 等 [论文] *(CVPR 2024)CosmicMan: A Text-to-Image Foundation Model for Humans,Shikai Li 等 [论文] [项目] *(ICML 2024)Fast Text-to-3D-Aware Face Generation and Manipulation via Direct Cross-modal Mapping and Geometric Regularization,Jinlu Zhang 等 [论文] [代码]
    *(NeurIPS 2023)Inserting Anybody in Diffusion Models via Celeb Basis,Ge Yuan 等 [论文] [项目] *(IJACSA 2023)Mukh-Oboyob: Stable Diffusion and BanglaBERT enhanced Bangla Text-to-Face Synthesis,Aloke Kumar Saha 等 [论文] [代码] *(SIGGRAPH 2023)[💬 3D] DreamFace: Progressive Generation of Animatable 3D Faces under Text Guidance,Longwen Zhang 等 [论文] [项目] [HuggingFace] *(CVPR 2023)[💬 3D] High-Fidelity 3D Face Generation from Natural Language Descriptions,Menghua Wu 等 [论文] [代码] [项目] *(CVPR 2023)Collaborative Diffusion for Multi-Modal Face Generation and Editing,Ziqi Huang 等 [论文] [代码] [项目] *(Pattern Recognition 2023)Where you edit is what you get: Text-guided image editing with region-based attention,Changming Xiao 等 [论文] [代码] *(arXiv 预印本 2022)Bridging CLIP and StyleGAN through Latent Alignment for Image Editing,Wanfeng Zheng 等 [论文] *(ACMMM 2022)Learning Dynamic Prior Knowledge for Text-to-Face Pixel Synthesis,Jun Peng 等 [论文] *(ACMMM 2022)Towards Open-Ended Text-to-Face Generation, Combination and Manipulation,Jun Peng 等 [论文] *(BMVC 2022)clip2latent: Text driven sampling of a pre-trained StyleGAN using denoising diffusion and CLIP,Justin N. M. Pinkney 等 [论文] [代码] *(arXiv 预印本 2022)ManiCLIP: Multi-Attribute Face Manipulation from Text,Hao Wang 等 [论文] *(arXiv 预印本 2022)Generated Faces in the Wild: Quantitative Comparison of Stable Diffusion, Midjourney and DALL-E 2,Ali Borji [论文] [代码] [数据] *(arXiv 预印本 2022)Text-Free Learning of a Natural Language Interface for Pretrained Face Generators,Xiaodan Du 等 [论文] [代码] *(Knowledge-Based Systems-2022)CMAFGAN: A Cross-Modal Attention Fusion based Generative Adversarial Network for attribute word-to-face synthesis,Xiaodong Luo 等 [论文] *(Neural Networks-2022)DualG-GAN, a Dual-channel Generator based Generative Adversarial Network for text-to-face synthesis,Xiaodong Luo 等 [论文] *(arXiv 预印本 2022)Text-to-Face Generation with StyleGAN2,D. M. A. Ayanthi 等 [论文] *(CVPR 2022)StyleT2I: Toward Compositional and High-Fidelity Text-to-Image Synthesis,Zhiheng Li 等 [论文] [代码] *(arXiv 预印本 2022)StyleT2F: Generating Human Faces from Textual Description Using StyleGAN2,Mohamed Shawky Sabae 等 [论文] [代码] *(CVPR 2022)AnyFace: Free-style Text-to-Face Synthesis and Manipulation,Jianxin Sun 等 [论文] *(IEEE Transactions on Network Science and Engineering-2022)TextFace: Text-to-Style Mapping based Face Generation and Manipulation,Xianxu Hou 等 [论文] *(CVPR 2021)TediGAN: Text-Guided Diverse Image Generation and Manipulation,Weihao Xia 等 [论文] [扩展版][代码] [数据集] [Colab] [视频] *(FG 2021)Generative Adversarial Network for Text-to-Face Synthesis and Manipulation with Pretrained BERT Model,Yutong Zhou 等 [论文] *(ACMMM 2021)Multi-caption Text-to-Face Synthesis: Dataset and Algorithm,Jianxin Sun 等 [论文] [代码] *(ACMMM 2021)Generative Adversarial Network for Text-to-Face Synthesis and Manipulation,Yutong Zhou [论文] *(WACV 2021)Faces a la Carte: Text-to-Face Generation via Attribute Disentanglement,Tianren Wang 等 [论文] *(arXiv 预印本 2019)FTGAN: A Fully-trained Generative Adversarial Networks for Text to Face Generation,Xiang Chen 等 [论文]

<🎯返回顶部>

  • 特定问题🤔 *(arXiv 预印本 2026)[🖼️ 美学数据集] Moonworks Lunara Aesthetic Dataset,Yan Wang 等 [论文] [数据集] *(arXiv 预印本 2026)[📸 变体数据集] Moonworks Lunara Aesthetic II: An Image Variation Dataset,Yan Wang 等 [论文] [数据集] *(arXiv 预印本 2025)[💬 可微目标计数] YOLO-Count: Differentiable Object Counting for Text-to-Image Generation,Guanning Zeng 等 [论文] *(arXiv 预印本 2024)[💬 性别偏见对齐] PopAlign: Population-Level Alignment for Fair Text-to-Image Generation,Shufan Li 等 [论文] [代码] *(arXiv 预印本 2024)[💬 细粒度反馈] Beyond Thumbs Up/Down: Untangling Challenges of Fine-Grained Feedback for Text-to-Image Generation,Katherine M. Collins 等 [论文] *(CVPR 2024-最佳论文)[💬 人类反馈] Rich Human Feedback for Text-to-Image Generation,Youwei Liang 等 [论文] *(ICLR 2024)[💬 未授权数据] DIAGNOSIS: Detecting Unauthorized Data Usages in Text-to-image Diffusion Models,Zhenting Wang 等 [论文] [代码] *(CVPR 2024)[💬 开放集偏见检测] OpenBias: Open-set Bias Detection in Text-to-Image Generative Models,Moreno D'Incà 等 [论文] *(arXiv 预印本 2024)[💬 空间一致性] Getting it Right: Improving Spatial Consistency in Text-to-Image Models,Agneet Chatterjee 等 [论文] [项目] [代码] [数据集] *(arXiv 预印本 2024)[💬 安全性] SafeGen: Mitigating Unsafe Content Generation in Text-to-Image Models,Xinfeng Li 等 [论文] [代码] *(arXiv 预印本 2024)[💬 美学] Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation,Daiqing Li 等 [论文] [项目] [HuggingFace] *(EMNLP 2023)[💬 文本视觉性] Learning the Visualness of Text Using Large Vision-Language Models,Gaurav Verma 等 [论文] [项目] *(arXiv 预印本 2023)[💬 对抗恶意适配] IMMA: Immunizing text-to-image Models against Malicious Adaptation,Yijia Zheng 等 [论文] [项目] *(arXiv 预印本 2023)[💬 原则性重新描述] A Picture is Worth a Thousand Words: Principled Recaptioning Improves Image Generation,Eyal Segalis 等 [论文]
    • ⭐⭐(NeurIPS 2023) [💬 整体性评估] Holistic Evaluation of Text-To-Image Models,Tony Lee 等 [论文] [代码] [项目] *(ICCV 2023)[💬 安全性] Rickrolling the Artist: Injecting Backdoors into Text Encoders for Text-to-Image Synthesis,Lukas Struppek 等 [论文] [代码] *(arXiv 预印本 2023)[💬 自然攻击能力] Intriguing Properties of Diffusion Models: A Large-Scale Dataset for Evaluating Natural Attack Capability in Text-to-Image Generative Models,Takami Sato 等 [论文] *(ACL 2023)[💬 偏见] A Multi-dimensional study on Bias in Vision-Language models,Gabriele Ruggeri 等 [论文] *(FAACT 2023)[💬 人口统计学刻板印象] Easily Accessible Text-to-Image Generation Amplifies Demographic Stereotypes at Large Scale,Federico Bianchi 等 [论文] *(arXiv 预印本 2023)[💬 鲁棒性] Evaluating the Robustness of Text-to-image Diffusion Models against Real-world Attacks,Hongcheng Gao 等 [论文] *(CVPR 2023)[💬 对抗鲁棒性分析] RIATIG: Reliable and Imperceptible Adversarial Text-to-Image Generation With Natural Prompts,Han Liu 等 [论文] *(arXiv 预印本 2023)[💬 Textual Inversion] Is This Loss Informative? Speeding Up Textual Inversion with Deterministic Objective Evaluation,Anton Voronov 等 [论文] [代码] *(arXiv 预印本 2022)[💬 可解释干预] Not Just Pretty Pictures: Text-to-Image Generators Enable Interpretable Interventions for Robust Representations,Jianhao Yuan 等 [论文] *(arXiv 预印本 2022)[💬 伦理图像操纵] Judge, Localize, and Edit: Ensuring Visual Commonsense Morality for Text-to-Image Generation,Seongbeom Park 等 [论文] *(arXiv 预印本 2022)[💬 创造力迁移] Inversion-Based Creativity Transfer with Diffusion Models,Yuxin Zhang 等 [论文] *(arXiv 预印本 2022)[💬 歧义性] Is the Elephant Flying? Resolving Ambiguities in Text-to-Image Generative Models,Ninareh Mehrabi 等 [论文] *(arXiv 预印本 2022)[💬 种族政治] A Sign That Spells: DALL-E 2, Invisual Images and The Racial Politics of Feature Space,Fabian Offert 等 [论文] *(arXiv 预印本 2022)[💬 隐私分析] Membership Inference Attacks Against Text-to-image Generation Models,Yixin Wu 等 [论文] *(arXiv 预印本 2022)[💬 虚假图像真实性评估] DE-FAKE: Detection and Attribution of Fake Images Generated by Text-to-Image Diffusion Models,Zeyang Sha 等 [论文] *(arXiv 预印本 2022)[💬 文化偏见] The Biased Artist: Exploiting Cultural Biases via Homoglyphs in Text-Guided Image Generation Models,Lukas Struppek 等 [论文]

<🎯返回顶部>

  • 2025

    • (arXiv 预印本 2025) GenExam: 多学科文本到图像测试集,Zhaokai Wang 等 [论文]
    • (arXiv 预印本 2025) RefVNLI: 面向主体驱动文本到图像生成的可扩展评估,Aviv Slobodkin 等 [论文]
    • (arXiv 预印本 2025) GPT-4o 图像生成能力的实证研究,Sixiang Chen 等 [论文]
  • 2024

    • (arXiv 预印本 2024) 流生成器匹配,Zemin Huang 等 [论文]
    • (EMNLP 2024) Kandinsky 3: 面向多功能生成框架的文本到图像合成,Vladimir Arkhipkin 等 [论文] [代码] [项目]
    • (arXiv 预印本 2024) 小数据集上文本到图像生成的数据外推,Senmao Ye 与 Fei Liu [论文]
    • ⭐⭐(arXiv 预印本 2024) Imagen 3,ImagenTeam-Google [论文]
    • (arXiv 预印本 2024) MARS: 用于细粒度文本到图像合成的自回归模型混合体,Wanggui He 等 [论文]
    • (快手) Kolors: 面向真实感文本到图像合成的扩散模型高效训练,Sixian Zhang 等 [论文] [代码] [项目]
    • (CVPR 2024) [💬人类偏好] 学习文本到图像生成的多维人类偏好,Sixian Zhang 等 [论文] [代码] [项目]
    • (CVPR 2024) [💬 文本到布局 → 文本+布局到图像] 基于注意力重聚焦的接地文本到图像合成,Quynh Phung 等 [论文] [项目] [代码]
    • (arXiv 预印本 2024) Dimba: Transformer-Mamba 扩散模型,Zhengcong Fei 等 [论文]
    • (arXiv 预印本 2024) [💬 生成与编辑] MultiEdits: 利用文本到图像扩散模型进行同时多方面编辑,Mingzhen Huang 等 [论文] [项目]
    • (arXiv 预印本 2024) AutoStudio: 在多轮交互式图像生成中打造一致主体,Junhao Cheng 等 [论文] [项目] [代码]
    • (arXiv 预印本 2024) TheaterGen: 结合 LLM 进行角色管理以实现一致的多轮图像生成,Junhao Cheng 等 [论文] [项目] [代码]
    • (CVPR 2024) Ranni: 驯服文本到图像扩散以实现精确指令遵循,Yutong Feng 等 [论文] [项目] [代码]
    • (arXiv 预印本 2024) CoMat: 通过图像到文本概念匹配对齐文本到图像扩散模型,Dongzhi Jiang 等 [论文] [项目] [代码]
    • (arXiv 预印本 2024) TextCraftor: 你的文本编码器可以是图像质量控制器,Yanyu Li 等 [论文]
    • (CVPR 2024) ECLIPSE: 面向图像生成的资源高效型文本到图像先验,Maitreya Patel 等 [论文] [项目] [代码] [Hugging Face]
    • (arXiv 预印本 2024) SELMA: 利用自动生成数据学习和融合特定技能的文本到图像专家模型,Jialu Li 等 [论文] [项目] [代码]
    • (ICLR 2024) PixArt-α: 用于真实感文本到图像合成的扩散 Transformer 快速训练,Junsong Chen 等 [论文] [项目] [代码] [Hugging Face]
    • (arXiv 预印本 2024) PixArt-Σ: 用于 4K 文本到图像生成的扩散 Transformer 弱到强训练,Junsong Chen 等 [论文]
    • (arXiv 预印本 2024) PIXART-δ: 具有潜在一致性模型的快速可控图像生成,Junsong Chen 等 [论文]
    • (CVPR 2024) 文本到图像生成的判别式探测与调优,Leigang Qu 等 [论文] [项目]
    • (CVPR 2024) RealCustom: 精简真实文本词以实现实时开放域文本到图像定制,Mengqi Huang 等 [论文] [项目]
    • ⭐(arXiv 预印本 2024) SDXL-Lightning: 渐进式对抗扩散蒸馏,Shanchuan Lin 等 [论文] [HuggingFace] [演示]
    • ⭐(arXiv 预印本 2024) RealCompo: 现实主义与组合性之间的动态平衡改进文本到图像扩散模型,Xinchen Zhang 等 [论文] [代码]
    • (arXiv 预印本 2024) 学习用于文本到图像生成的连续 3D 词,Ta-Ying Cheng 等 [论文] [项目] [代码]
    • (arXiv 预印本 2024) DiffusionGPT: LLM 驱动的文本到图像生成系统,Jie Qin 等 [论文] [项目] [代码]
    • (arXiv 预印本 2024) DressCode: 从文本指导中自回归地缝制和生成服装,Kai He 等 [论文] [项目]

<🎯返回顶部>

  • 2023
    • (arXiv预印本 2023) CoDi-2: 上下文内、交错式及交互式任意到任意生成,Zineng Tang 等 [论文] [项目] [代码]
    • (arXiv预印本 2023) DiffBlender: 可扩展且可组合的多模态文本到图像扩散模型,Sungnyun Kim 等 [论文] [代码] [项目]
    • (arXiv预印本 2023) ElasticDiffusion: 无训练的任意尺寸图像生成,Moayed Haji-Ali 等 [论文] [项目] [代码] [演示]
    • (ICCV 2023) BoxDiff: 基于无训练框约束扩散的文本到图像合成,Jinheng Xie 等 [论文] [代码]
    • (arXiv预印本 2023) 用于可控图像合成的后期约束扩散引导,Chang Liu 等 [论文] [代码]
    • (arXiv预印本 2023) 一图胜多言:用于约束文本到图像合成的多属性反转,Aishwarya Agarwal 等 [论文]
    • ⭐(arXiv预印本 2023) UFOGen: 通过扩散GAN实现一次前向传播的大规模文本到图像生成,Yanwu Xu 等 [论文]
    • (ICCV 2023) ITI-GEN: 包容性文本到图像生成,Cheng Zhang 等 [论文] [代码] [项目]
    • (arXiv预印本 2023) Mini-DALLE3: 通过提示大型语言模型实现交互式文本到图像生成,Zeqiang Lai 等 [论文] [代码] [演示] [项目]
    • (arXiv预印本 2023) [💬评估] GenEval: 面向文本到图像对齐评估的对象聚焦框架,Dhruba Ghosh 等 [论文] [代码]
    • ⭐(arXiv预印本 2023) Kandinsky: 结合图像先验与潜在扩散的改进型文本到图像合成,Anton Razzhigaev 等 [论文] [代码] [演示] [演示视频] [Hugging Face]
    • ⭐⭐(ICCV 2023) 为文本到图像扩散模型添加条件控制,Lvmin Zhang 等 [论文] [代码]
    • (ICCV 2023) DiffCloth: 基于结构跨模态语义对齐的扩散式服装合成与操控,Xujie Zhang 等 [论文]
    • (ICCV 2023) 利用文本到图像生成模型进行无监督组合概念发现,Nan Liu 等 [论文] [代码] [项目]
    • (arXiv预印本 2023) 面向抽象概念的文本到图像生成,Jiayi Liao 等 [论文]
    • (arXiv预印本 2023) T2I-CompBench: 开放世界组合式文本到图像生成综合基准,Kaiyi Huang 等 [论文] [代码] [项目]
    • (arXiv预印本 2023) [💬 评估] 人类偏好分数 v2: 文本到图像合成人类偏好评估的可靠基准,Xiaoshi Wu 等 [论文] [代码]
    • (arXiv预印本 2023) 迈向统一的文本基人物检索:大规模多属性与语言搜索基准,Shuyu Yang 等 [论文] [代码] [项目]
    • (arXiv预印本 2023) 从文本合成艺术动态照片,Aniruddha Mahapatra 等 [论文] [代码] [项目]
    • (arXiv预印本 2023) 多对象文本到图像生成的检测器引导,Luping Liu 等 [论文]
    • (arXiv预印本 2023) A-STAR: 文本到图像合成的测试时注意力分离与保留,Aishwarya Agarwal 等 [论文]
    • (arXiv预印本 2023) [💬评估] ConceptBed: 评估文本到图像扩散模型的概念学习能力,Maitreya Patel 等 [论文] [代码] [项目]
    • ⭐(arXiv预印本 2023) StyleDrop: 任意风格的文本到图像生成,Kihyuk Sohn 等 [论文] [项目]
    • ⭐⭐(arXiv预印本 2023) 无提示扩散:从文本到图像扩散模型中去除"文本",Xingqian Xu 等 [论文] [代码] [Hugging Face]
    • ⭐⭐ (SIGGRAPH 2023) 混合潜在扩散,Omri Avrahami 等 [论文] [代码] [项目]
    • (CVPR 2023) [💬可控性] SpaText: 用于可控图像生成的空间文本表示,Omri Avrahami 等 [论文] [项目]
    • ⭐⭐ (arXiv 2023) 天选之人:文本到图像扩散模型中的一致性角色,Omri Avrahami 等 [论文] [代码] [项目]
    • (CVPR 2023) [💬基于脑活动的Stable Diffusion] 利用潜在扩散模型从人类脑活动重建高分辨率图像,Yu Takagi 等 [论文]
    • (arXiv预印本 2023) BLIP-Diffusion: 用于可控文本到图像生成与编辑的预训练主体表示,Dongxu Li 等 [论文]
    • (arXiv预印本 2023) [💬评估] LLMScore: 揭示大型语言模型在文本到图像合成评估中的力量,Yujie Lu 等 [论文] [代码]
    • (arXiv预印本 2023) P+:文本到图像生成中的扩展文本条件,Andrey Voynov 等 [论文] [项目]
    • (arXiv预印本 2023) Taming Encoder:基于文本到图像扩散模型的零微调图像定制,Xuhui Jia 等 [论文]
    • (ICML 2023) TR0N: 用于零样本即插即用条件生成的转换器网络,Zhaoyan Liu 等 [论文] [代码] [Hugging Face]
    • (ICLR 2023) [💬3D]DreamFusion: 利用2D扩散实现文本到3D生成,Ben Poole 等 [论文 (arXiv)] [论文 (OpenReview)] [项目] [简读]
    • (ICLR 2023) 用于组合式文本到图像合成的无训练结构化扩散引导,Weixi Feng 等 [论文 (arXiv)] [论文 (OpenReview)] [代码]
    • ⭐⭐(arXiv预印本 2023) Pick-a-Pic: 文本到图像生成的用户偏好开放数据集,Yuval Kirstain 等 [论文] [代码] [数据集] [在线应用] [PickScore]
    • (arXiv预印本 2023) TTIDA: 通过文本到文本和文本到图像模型实现可控生成式数据增强,Yuwei Yin 等 [论文]
    • (arXiv预印本 2023) [💬 文本反转] 用于个性化文本到图像生成的可控文本反转,Jianan Yang 等 [论文]
    • (arXiv预印本 2023) Diffusion Explainer: 文本到图像Stable Diffusion的可视化解释,Seongmin Lee 等 [论文] [项目]
    • ⭐⭐(Findings of ACL 2023) [💬 多语言到图像] AltCLIP: 改变CLIP中的语言编码器以扩展语言能力,Zhongzhi Chen 等 [论文] [代码-AltDiffusion] [代码-AltCLIP] [Hugging Face]
    • (arXiv预印本 2023) [💬 种子选择] 一切始于起点:带种子选择的文本到图像生成,Dvir Samuel 等 [论文]
    • (arXiv预印本 2023) [💬 音频/声音/多语言到图像] GlueGen: 用于X到图像生成的即插即用多模态编码器,Can Qin 等 [论文]
    • (arXiv预印本 2023) [💬忠实度评估] TIFA: 基于问答的准确且可解释的文本到图像忠实度评估,Yushi Hu 等 [论文] [项目] [代码]
    • (arXiv预印本 2023) InstantBooth: 无需测试时微调的个性化文本到图像生成,Jing Shi 等 [论文] [项目]
    • (TOMM 2023) LFR-GAN: 基于局部特征细化的生成对抗网络用于文本到图像生成,Zijun Deng 等 [论文] [代码]
    • (ICCV 2023) 利用富文本进行富有表现力的文本到图像生成,Songwei Ge 等 [论文] [代码] [项目] [演示]
    • (arXiv预印本 2023) [💬人类偏好] ImageReward: 学习和评估文本到图像生成的人类偏好,Jiazheng Xu 等 [论文] [代码]
    • (arXiv预印本 2023) eDiff-I: 具有专家去噪器集成的文本到图像扩散模型,Yogesh Balaji 等 [论文] [项目]
    • (CVPR 2023) GALIP: 用于文本到图像合成的生成对抗CLIPs,Ming Tao 等 [论文] [代码]
    • (CVPR 2023) [💬人类评估] 迈向文本到图像生成的可验证和可重现人类评估,Mayu Otani 等 [论文]
    • (arXiv预印本 2023) Text2Room: 从2D文本到图像模型提取带纹理的3D网格,Lukas Höllein 等 [论文] [项目] [代码] [视频]
    • (arXiv预印本 2023) 编辑文本到图像扩散模型中的隐含假设,Hadas Orgad 等 [论文] [项目] [代码]
    • ⭐⭐(arXiv预印本 2023) Visual ChatGPT: 与视觉基础模型对话、绘画和编辑,Chenfei Wu 等 [论文] [代码]
    • (arXiv预印本 2023) X&Fuse: 在文本到图像生成中融合视觉信息,Yuval Kirstain 等 [论文]
    • (CVPR 2023) [💬基于脑活动的Stable Diffusion] 利用潜在扩散模型从人类脑活动重建高分辨率图像,Yu Takagi 等 [论文] [项目] [代码]
    • ⭐⭐(arXiv预印本 2023) 扩散模型的通用引导,Arpit Bansal 等 [论文] [代码]
    • ⭐(arXiv预印本 2023) Attend-and-Excite: 基于注意力的文本到图像扩散模型语义引导,Hila Chefer 等 [论文] [项目] [代码]
    • (BMVC 2023) Divide & Bind Your Attention for Improved Generative Semantic Nursing,Yumeng Li 等 [论文] [项目] [代码]
    • (IEEE Transactions on Multimedia) ALR-GAN: 用于文本到图像合成的自适应布局细化,Hongchen Tan 等 [论文]
    • ⭐(CVPR 2023) 文本到图像扩散的多概念定制,Nupur Kumari 等 [论文] [项目] [代码] [Hugging Face]
    • (CVPR 2023) GLIGEN: 开放集接地文本到图像生成,Yuheng Li 等 [论文] [代码] [项目] [Hugging Face演示]
    • (arXiv预印本 2023) 以属性为中心的组合式文本到图像生成,Yuren Cong 等 [论文] [项目]
    • (arXiv预印本 2023) Muse: 通过掩码生成Transformer实现文本到图像生成,Huiwen Chang 等 [论文] [项目]

<🎯返回顶部>

6. 其他相关工作

  • 📝提示词工程📝 * (CHI 2024) PromptCharm: Text-to-Image Generation through Multi-modal Prompting and Refinement,王志杰等人 [论文] * (arXiv 预印本 2024) Automated Black-box Prompt Engineering for Personalized Text-to-Image Generation,何宇桐等人 [论文] * (EMNLP 2023) BeautifulPrompt: Towards Automatic Prompt Engineering for Text-to-Image Synthesis,曹庭峰等人 [论文] * (arXiv 预印本 2023) [💬提示词优化] NeuroPrompts: An Adaptive Framework to Optimize Prompts for Text-to-Image Generation,沙查尔·罗森曼等人 [论文] [视频演示] * (arXiv 预印本 2022) [💬提示词优化] Optimizing Prompts for Text-to-Image Generation,郝雅如等人 [论文] [代码] [Hugging Face] * (arXiv 预印本 2022) [💬美学图像生成] Best Prompts for Text-to-Image Models and How to Find Them,尼基塔·帕夫利琴科等人 [论文] * (arXiv 预印本 2022) A Taxonomy of Prompt Modifiers for Text-To-Image Generation,乔纳斯·奥本兰德 [论文] * (CHI 2022) Design Guidelines for Prompt Engineering Text-to-Image Generative Models,薇薇安·刘等人 [论文]

<🎯返回顶部>

  • ⭐多模态⭐ * (arXiv 预印本 2024) 4M-21: An Any-to-Any Vision Model for Tens of Tasks and Modalities,罗曼·巴赫曼等人 [论文] [4M 论文] [项目] [代码] * 📚 任意模态到任意模态、RGB 到所有模态(描述、边界框、语义分割、深度等)、细粒度生成与编辑、多模态引导、任意模态到 RGB 检索、RGB 到任意模态检索 * (arXiv 预印本 2024) Ctrl-X: Controlling Structure and Appearance for Text-To-Image Generation Without Guidance,林冠亨等人 [论文] [项目] * 📚 结构(自然图像、边缘图、法线图、线框图、3D 网格等)+ 图像 → 图像,结构(掩码、3D 网格、边缘图、深度图等)+ 文本 → 图像 * (arXiv 预印本 2024) Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers,高鹏等人 [论文] [代码] * 📚 文本 → 图像/视频/音频/3D/音乐 * (ICLR 2024) Cross-Modal Contextualized Diffusion Models for Text-Guided Visual Generation and Editing,杨凌等人 [论文] [代码] * 📚 文本 → 图像,文本 → 视频 * (arXiv 预印本 2024) TMT: Tri-Modal Translation between Speech, Image, and Text by Processing Different Modalities as Different Languages,金敏洙等人 [论文] * 📚 图像 → 文本,图像 → 语音,文本 → 图像,语音 → 图像,语音 → 文本,文本 → 语音 * ⭐⭐(NeurIPS 2023) CoDi: Any-to-Any Generation via Composable Diffusion,唐子宁等人 [论文] [项目] [代码] * 📚[单模态到单模态生成] 文本 → 图像,音频 → 图像,图像 → 视频,图像 → 音频,音频 → 文本,图像 → 文本 * 📚[多输出联合生成] 文本 → 视频 + 音频,文本 → 文本 + 音频 + 图像,文本 + 图像 → 文本 + 图像 * 📚[多条件控制] 文本 + 音频 → 图像,文本 + 图像 → 图像,文本 + 音频 + 图像 → 图像,文本 + 音频 → 视频,文本 + 图像 → 视频,视频 + 音频 → 文本,图像 + 音频 → 音频,文本 + 图像 → 音频 * ⭐⭐(CVPR 2023) ImageBind: One Embedding Space To Bind Them All,罗希特·吉达尔等人 [论文] [项目] [代码] * 📚图像到音频检索、音频到图像检索、文本到图像+音频、音频+图像到图像、音频到图像生成、零样本文本到音频检索与分类等 * ⭐(CVPR 2023) Scaling up GANs for Text-to-Image Synthesis,康明国等人 [论文] [项目] * 📚文本到图像、可控图像合成(风格混合、提示词插值、提示词混合)、超分辨率(文本条件、无条件) * (arXiv 预印本 2023) DiffBlender: Scalable and Composable Multimodal Text-to-Image Diffusion Models,金圣云等人 [论文] [代码] [项目] * 📚文本到图像、多模态可控图像合成、文本 + 图像 + 空间/非空间标记 → 图像 * (arXiv 预印本 2023) TextIR: A Simple Framework for Text-based Editable Image Restoration,白云鹏等人 [论文] [代码] * 📚图像修复、图像上色、图像超分辨率、基于退化的图像编辑 * (arXiv 预印本 2023) Modulating Pretrained Diffusion Models for Multimodal Image Synthesis,哈姆·库苏等人 [论文] * 📚草图到图像、分割图到图像、文本+草图到图像、文本+分割图到图像、文本+草图+分割图到图像 * (arXiv 预印本 2023) Muse: Text-To-Image Generation via Masked Generative Transformers,张慧雯等人 [论文] [项目] * 📚文本到图像、零样本+无掩码编辑、零样本修复/扩图 * (arXiv 预印本 2022) Versatile Diffusion: Text, Images and Variations All in One Diffusion Model,徐星潜等人 [论文] [代码] [Hugging Face] * 📚文本到图像、图像变体、图像到文本、解耦、文本+图像引导生成、可编辑图像到文本到图像 * (arXiv 预印本 2022) Frido: Feature Pyramid Diffusion for Complex Scene Image Synthesis,范万权等人 [论文] [代码] * 📚文本到图像、场景图到图像、布局到图像、无条件图像生成 * (arXiv 预印本 2022) NUWA-Infinity: Autoregressive over Autoregressive Generation for Infinite Visual Synthesis,吴晨飞等人 [论文] [代码] [项目] * 📚无条件图像生成(高清)、文本到图像(高清)、图像动画(高清)、图像扩图(高清)、文本到视频(高清) * (ECCV 2022) NÜWA: Visual Synthesis Pre-training for Neural visUal World creAtion,吴晨飞等人 [论文] [代码] * 多模态预训练模型,支持多任务🎄:文本到图像、草图到图像、图像补全、文本引导的图像操作、文本到视频、视频预测、草图到视频、文本引导的视频操作 * (ACMMM 2022) Rethinking Super-Resolution as Text-Guided Details Generation,马晨曦等人 [论文] * 📚文本到图像、高分辨率、文本引导的高分辨率 * (arXiv 预印本 2022) Discrete Contrastive Diffusion for Cross-Modal and Conditional Generation,朱烨等人 [论文] [代码] * 📚文本到图像、舞蹈到音乐、类别到图像 * (arXiv 预印本 2022) M6-Fashion: High-Fidelity Multi-modal Image Generation and Editing,李志康等人 [论文] * 📚文本到图像、无条件图像生成、局部编辑、文本引导的局部编辑、修复/扩图、风格混合 * (CVPR 2022) Show Me What and Tell Me How: Video Synthesis via Multimodal Conditioning,约吉什·巴拉吉等人 [论文] [代码] 项目 * 📚文本到视频、独立多模态控制、依赖多模态控制 * ⭐⭐(CVPR 2022) High-Resolution Image Synthesis with Latent Diffusion Models,罗宾·龙巴赫等人 [论文] [代码] [Stable Diffusion 代码] * 📚文本到图像、条件潜扩散、超分辨率、图像修复 * ⭐⭐(arXiv 预印本 2022) Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework,王鹏等人 [论文] [代码] [Hugging Face] * 📚文本到图像生成、图像描述、文本摘要、自监督图像分类、[SOTA] 指代表达理解、视觉蕴含、视觉问答 * (arXiv 预印本 2021) Multimodal Conditional Image Synthesis with Product-of-Experts GANs,黄迅等人 [论文] [项目] * 📚文本到图像、分割图到图像、文本+分割图/草图/图像→图像、草图+分割图/图像→图像、分割图+图像→图像 * (NeurIPS 2021) M6-UFC: Unifying Multi-Modal Controls for Conditional Image Synthesis via Non-Autoregressive Generative Transformers,张柱等人 [论文] * 📚文本到图像、草图到图像、风格迁移、图像修复、多模态控制到图像 * (arXiv 预印本 2021) ERNIE-ViLG: Unified Generative Pre-training for Bidirectional Vision-Language Generation,张晗等人 [论文] * 一个预训练的100亿参数模型:ERNIE-ViLG。 * 一个包含1.45亿高质量中文图文对的大规模数据集。 * 📚文本到图像、图像描述、生成式视觉问答 * (arXiv 预印本 2021) Multimodal Conditional Image Synthesis with Product-of-Experts GANs,黄迅等人 [论文] [项目] * 📚文本到图像、分割图到图像、文本+分割图/草图/图像 → 图像、草图+分割图/图像 → 图像、分割图+图像 → 图像 * (arXiv 预印本 2021) L-Verse: Bidirectional Generation Between Image and Text,金泰勋等人 [论文] [代码] * 📚文本到图像、图像到文本、图像重建 * (arXiv 预印本 2021) [💬语义扩散引导] More Control for Free! Image Synthesis with Semantic Diffusion Guidance,刘锡辉等人 [论文] [项目] * 📚文本到图像、图像到图像、文本+图像 → 图像

<🎯返回顶部>

  • 🛫应用领域🛫 * (arXiv 预印本 2024) [💬照片修饰] JarvisArt: Liberating Human Artistic Creativity via an Intelligent Photo Retouching Agent,林云龙等人 [论文] [项目] [代码] * (CVPR 2025) [💬图像恢复] Acquire and then Adapt: Squeezing out Text-to-Image Model for Image Restoration,邓俊远等人 [论文] * (arXiv 预印本 2024) [💬多概念组合] Gen4Gen: Generative Data Pipeline for Generative Multi-Concept Composition,叶俊孝等人 [论文] [项目] [代码] * (arXiv 预印本 2023) [💬3D 发型生成] HAAR: Text-Conditioned Generative Model of 3D Strand-based Human Hairstyles,瓦妮莎·斯克莱罗娃等人 [论文] [项目] * (arXiv 预印本 2023) [💬图像超分辨率] Image Super-Resolution with Text Prompt Diffusion,陈铮等人 [论文] [代码] * (2023) [💬图像编辑] Generative Fill [项目] * (arXiv 预印本 2023) [💬大语言模型] LLM as an Art Director (LaDi): Using LLMs to improve Text-to-Media Generators,艾伦·劳什等人 [论文] * (arXiv 预印本 2023) [💬分割] SegGen: Supercharging Segmentation Models with Text2Mask and Mask2Img Synthesis,叶瀚荣等人 [论文] [项目] * (arXiv 预印本 2023) [💬文本编辑] DiffUTE: Universal Text Editing Diffusion Model,陈浩星等人 [论文] * (arXiv 预印本 2023) [💬文本字符生成] TextDiffuser: Diffusion Models as Text Painters,陈敬野等人 [论文] * (CVPR 2023) [💬开放词汇全景分割] Open-Vocabulary Panoptic Segmentation with Text-to-Image Diffusion Models,徐家瑞等人 [论文] [代码] 项目] HuggingFace] * (arXiv 预印本 2023) [💬中文字符生成] GlyphDraw: Learning to Draw Chinese Characters in Image Synthesis Models Coherently,马健等人 [论文] [项目] * (arXiv 预印本 2023) [💬接地生成] Guiding Text-to-Image Diffusion Model Towards Grounded Generation,李子怡等人 [论文] [代码] 项目] * (arXiv 预印本 2022) [💬语义分割] CLIP is Also an Efficient Segmenter: A Text-Driven Approach for Weakly Supervised Semantic Segmentation,林雨琪等人 [论文] [代码] * (arXiv 预印本 2022) [💬无监督语义分割] Peekaboo: Text to Image Diffusion Models are Zero-Shot Segmentors,瑞安·伯格特等人 [论文] * (SIGGRAPH Asia 2022) [💬文本+语音→手势] Rhythmic Gesticulator: Rhythm-Aware Co-Speech Gesture Synthesis with Hierarchical Neural Embeddings,敖腾龙等人 [论文] [代码] * (arXiv 预印本 2022) [💬文本+图像+形状→图像] Shape-Guided Diffusion with Inside-Outside Attention,朴东赫等人 [论文] [项目]

<🎯返回顶部>

  • 文本+图像/视频 → 图像/视频 * (arXiv预印本 2025) In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer,Zechuan Zhang 等 [论文] [项目] [代码] * (arXiv预印本 2025) MAGREF: Masked Guidance for Any-Reference Video Generation,Yufan Deng 等 [论文] [项目] [代码] * (arXiv预印本 2025) Generating Multi-Image Synthetic Data for Text-to-Image Customization,Nupur Kumari 等 [论文] [项目] [代码] * (arXiv预印本 2024) [💬风格迁移] StyleShot: A Snapshot on Any Style,Junyao Gao 等 [论文] [项目] * (CVPR 2024) SmartEdit: Exploring Complex Instruction-based Image Editing with Multimodal Large Language Models,Yuzhou Huang 等 [论文] [项目] [代码] * (arXiv预印本 2024) MM-Diff: High-Fidelity Image Personalization via Multi-Modal Condition Integration,Zhichao Wei 等 [论文] * (CVPR 2024) Instruct-Imagen: Image Generation with Multi-modal Instruction,Hexiang Hu 等 [论文] [项目] * (arXiv预印本 2024) [💬神经辐射场] InseRF: Text-Driven Generative Object Insertion in Neural 3D Scenes,Mohamad Shahbazi 等 [论文] [项目] * (arXiv预印本 2023) ViCo: Plug-and-play Visual Condition for Personalized Text-to-image Generation,Shaozhe Hao 等 [论文] [代码] * (arXiv预印本 2023) [💬视频编辑] MagicStick: Controllable Video Editing via Control Handle Transformations,Yue Ma 等 [论文] [项目] [代码] * (arXiv预印本 2023) Lego: Learning to Disentangle and Invert Concepts Beyond Object Appearance in Text-to-Image Diffusion Models,Chen Henry Wu 等 [论文] * (ACMMM 2023) [💬风格迁移] ControlStyle: Text-Driven Stylized Image Generation Using Diffusion Priors,Jingwen Chen 等 [论文] * (ICCV 2023) A Latent Space of Stochastic Diffusion Models for Zero-Shot Image Editing and Guidance,Chen Henry Wu 等 [论文] [预印本] [代码] * (arXiv预印本 2023) [💬多主体生成] VideoDreamer: Customized Multi-Subject Text-to-Video Generation with Disen-Mix Finetuning,Hong Chen 等 [论文] [项目] [代码] * (arXiv预印本 2023) [💬视频编辑] CCEdit: Creative and Controllable Video Editing via Diffusion Models,Ruoyu Feng 等 [论文] [演示视频] * ⭐⭐ (SIGGRAPH Asia 2023) Break-A-Scene: Extracting Multiple Concepts from a Single Image,Omri Avrahami 等 [论文] [项目] [代码] * (arXiv预印本 2023) Visual Instruction Inversion: Image Editing via Visual Prompting,Thao Nguyen 等 [论文] [项目] * (CVPR 2023) [💬三维形状编辑] ShapeTalk: A Language Dataset and Framework for 3D Shape Edits and Deformations,Panos Achlioptas 等 [论文] [代码] [项目] * (arXiv预印本 2023) [💬图像上色] DiffColor: Toward High Fidelity Text-Guided Image Colorization with Diffusion Models,Jianxin Lin 等 [论文] * (ICCV 2023) [💬视频编辑] FateZero: Fusing Attentions for Zero-shot Text-based Video Editing,Chenyang Qi 等 [论文] [代码] [项目] Hugging Face] * (arXiv预印本 2023) [💬三维] AvatarVerse: High-quality & Stable 3D Avatar Creation from Text and Pose,Huichao Zhang 等 [论文] [项目] * (ACM Transactions on Graphics 2023) CLIP-Guided StyleGAN Inversion for Text-Driven Real Image Editing,Ahmet Canberk Baykal 等 [论文] * (arXiv预印本 2023) ⭐⭐AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning,Yuwei Guo 等 [论文] [项目] [代码] * (ICLR 2023) DiffEdit: Diffusion-based semantic image editing with mask guidance,Guillaume Couairon 等 [论文] * (arXiv预印本 2023) Controlling Text-to-Image Diffusion by Orthogonal Finetuning,Zeju Qiu 等 [论文] [项目] [代码] * (arXiv预印本 2023) [💬拒绝人类指令] Accountable Textual-Visual Chat Learns to Reject Human Instructions in Image Re-creation,Zhiwei Zhang 等 [论文] [项目] [代码] * (arXiv预印本 2023) MultiFusion: Fusing Pre-Trained Models for Multi-Lingual, Multi-Modal Image Generation,Marco Bellagente 等 [论文] * (CVPR 2023) Text-Guided Unsupervised Latent Transformation for Multi-Attribute Image Manipulation,Xiwen Wei 等 [论文] * (arXiv预印本 2023) Uni-ControlNet: All-in-One Control to Text-to-Image Diffusion Models,Shihao Zhao 等 [论文] [项目] * (arXiv预印本 2023) Unified Multi-Modal Latent Diffusion for Joint Subject and Text Conditional Image Generation,Yiyang Ma 等 [论文] * (arXiv预印本 2023) DisenBooth: Disentangled Parameter-Efficient Tuning for Subject-Driven Text-to-Image Generation,Hong Chen 等 [论文] * (arXiv预印本 2023) [💬图像编辑] Guided Image Synthesis via Initial Image Editing in Diffusion Model,Jiafeng Mao 等 [论文] * (arXiv预印本 2023) [💬图像编辑] Prompt Tuning Inversion for Text-Driven Image Editing Using Diffusion Models,Wenkai Dong 等 [论文] * (CVPR 2023) DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation,Nataniel Ruiz 等 [论文] [项目] * (arXiv预印本 2023) Shape-Guided Diffusion with Inside-Outside Attention,Dong Huk Park 等 [论文] [代码] [项目] Hugging Face] * (arXiv预印本 2023) [💬图像编辑] iEdit: Localised Text-guided Image Editing with Weak Supervision,Rumeysa Bodur 等 [论文] * (PR 2023) [💬行人重识别] BDNet: A BERT-based Dual-path Network for Text-to-Image Cross-modal Person Re-identification,Qiang Liu 等 [论文] * (arXiv预印本 2023) MagicFusion: Boosting Text-to-Image Generation Performance by Fusing Diffusion Models,Jing Zhao 等 [论文] [代码] 项目] * (CVPR 2023) [💬三维] TAPS3D: Text-Guided 3D Textured Shape Generation from Pseudo Supervision,Jiacheng Wei 等 [论文] * ⭐⭐(arXiv预印本 2023) [💬图像编辑] MasaCtrl: Tuning-free Mutual Self-Attention Control for Consistent Image Synthesis and Editing,Mingdeng Cao 等 [论文] [代码] [项目] * (arXiv预印本 2023) Follow Your Pose: Pose-Guided Text-to-Video Generation using Pose-Free Videos,Yue Ma 等 [论文] [代码] [Hugging Face] * ⭐⭐(arXiv预印本 2023) [💬图像编辑] Delta Denoising Score,Amir Hertz 等 [论文] * (arXiv预印本 2023) Subject-driven Text-to-Image Generation via Apprenticeship Learning,Wenhu Chen 等 [论文] [项目] * (arXiv预印本 2023) [💬图像编辑] Region-Aware Diffusion for Zero-shot Text-driven Image Editing,Nisha Huang 等 [论文] [代码] * ⭐⭐(arXiv预印本 2023) [💬文本+视频→视频]Structure and Content-Guided Video Synthesis with Diffusion Models,Patrick Esser 等 [论文] [项目] * (arXiv预印本 2023) ELITE: Encoding Visual Concepts into Textual Embeddings for Customized Text-to-Image Generation,Yuxiang Wei 等 [论文] * (arXiv预印本 2023) [💬时尚图像编辑] FICE: Text-Conditioned Fashion Image Editing With Guided GAN Inversion,Martin Pernuš 等 [论文] [代码] * (AAAI 2023) CLIPVG: Text-Guided Image Manipulation Using Differentiable Vector Graphics,Yiren Song 等 [论文] * (AAAI 2023) DE-Net: Dynamic Text-guided Image Editing Adversarial Networks,Ming Tao 等 [论文] [代码] * (arXiv预印本 2022) Plug-and-Play Diffusion Features for Text-Driven Image-to-Image Translation,Narek Tumanyan 等 [论文] [项目] * (arXiv预印本 2022) [💬文本+图像→视频] Tell Me What Happened: Unifying Text-guided Video Completion via Multimodal Masked Video Generation,Tsu-Jui Fu 等 [论文] * (arXiv预印本 2022) [💬图像风格化] DiffStyler: Controllable Dual Diffusion for Text-Driven Image Stylization,Nisha Huang 等 [论文] [代码] * (arXiv预印本 2022) Null-text Inversion for Editing Real Images using Guided Diffusion Models,Ron Mokady 等 [论文] [项目] * (arXiv预印本 2022) InstructPix2Pix: Learning to Follow Image Editing Instructions,Tim Brooks 等 [论文] [项目] * (ECCV 2022) [💬风格迁移] Language-Driven Artistic Style Transfer,Tsu-Jui Fu 等 [论文] [代码] * (arXiv预印本 2022) Bridging CLIP and StyleGAN through Latent Alignment for Image Editing,Wanfeng Zheng 等 [论文] * (NeurIPS 2022) One Model to Edit Them All: Free-Form Text-Driven Image Manipulation with Semantic Modulations,Yiming Zhu 等 [论文] [代码] * (BMVC 2022) LDEdit: Towards Generalized Text Guided Image Manipulation via Latent Diffusion Models,Paramanand Chandramouli 等 [论文] * (ACMMM 2022) [💬基于语言的迭代图像操作] LS-GAN: Iterative Language-based Image Manipulation via Long and Short Term Consistency Reasoning,Gaoxiang Cong 等 [论文] * (ACMMM 2022) [💬数字艺术合成] Draw Your Art Dream: Diverse Digital Art Synthesis with Multimodal Guided Diffusion,Huang Nisha 等 [论文] [代码] * (SIGGRAPH Asia 2022) [💬HDR全景图生成] Text2Light: Zero-Shot Text-Driven HDR Panorama Generation,Zhaoxi Chen 等 [论文] [项目] [代码] * (arXiv预印本 2022) LANIT: Language-Driven Image-to-Image Translation for Unlabeled Data,Jihye Park 等 [论文] [项目] [代码] * (ACMMM PIES-ME 2022) [💬三维语义风格迁移] Language-guided Semantic Style Transfer of 3D Indoor Scenes,Bu Jin 等 [论文] [代码] * (arXiv预印本 2022) [💬人脸动画] Language-Guided Face Animation by Recurrent StyleGAN-based Generator,Tiankai Hang 等 [论文] [代码] * (arXiv预印本 2022) [💬时尚设计] ARMANI: Part-level Garment-Text Alignment for Unified Cross-Modal Fashion Design,Xujie Zhang 等 [论文] [代码] * (arXiv预印本 2022) [💬图像上色] TIC: Text-Guided Image Colorization,Subhankar Ghosh 等 [论文] * (ECCV 2022) [💬人体网格动画] CLIP-Actor: Text-Driven Recommendation and Stylization for Animating Human Meshes,Kim Youwang 等 [论文] [代码] * (ECCV 2022) [💬姿态合成] TIPS: Text-Induced Pose Synthesis,Prasun Roy 等 [论文] [代码] [项目] * (ACMMM 2022) [💬行人重识别] Learning Granularity-Unified Representations for Text-to-Image Person Re-identification,Zhiyin Shao 等 [论文] [代码] * (ACMMM 2022) Towards Counterfactual Image Manipulation via CLIP,Yingchen Yu 等 [论文] [代码] * (ACMMM 2022) [💬单目深度估计] Can Language Understand Depth?,Wangbo Zhao 等 [论文] [代码] * (arXiv预印本 2022) [💬图像风格迁移] Referring Image Matting,Tsu-Jui Fu 等 [论文] * (CVPR 2022) [💬图像分割] Image Segmentation Using Text and Image Prompts,Timo Lüddecke 等 [论文] [代码] * (CVPR 2022) [💬视频分割] Modeling Motion with Multi-Modal Features for Text-Based Video Segmentation,Wangbo Zhao 等 [论文] [代码] * (arXiv预印本 2022) [💬图像抠图] Referring Image Matting,Sebastian Loeschcke 等 [论文] [数据集] * (arXiv预印本 2022) [💬视频对象风格化] Text-Driven Stylization of Video Objects,Sebastian Loeschcke 等 [论文] [项目] * (arXiv预印本 2022) DALL-E for Detection: Language-driven Context Image Synthesis for Object Detection,Yunhao Ge 等 [论文] * (IEEE Transactions on Neural Networks and Learning Systems 2022) [💬姿态引导人物生成] Verbal-Person Nets: Pose-Guided Multi-Granularity Language-to-Person Generation,Deyin Liu 等 [论文] * (SIGGRAPH 2022) [💬三维虚拟化身生成] AvatarCLIP: Zero-Shot Text-Driven Generation and Animation of 3D Avatars,Fangzhou Hong 等 [论文] [代码] [项目] * ⭐⭐(arXiv预印本 2022) [💬图像与视频编辑] Text2LIVE: Text-Driven Layered Image and Video Editing,Omer Bar-Tal 等 [论文] [项目] * (Machine Vision and Applications 2022) Paired-D++ GAN for image manipulation with text,Duc Minh Vo 等 [论文] * (CVPR 2022) [💬发型迁移] HairCLIP: Design Your Hair by Text and Reference Image,Tianyi Wei 等 [论文] [代码]

  • (CVPR 2022) [💬NeRF] CLIP-NeRF:文本与图像驱动的神经辐射场操控,Can Wang 等人 [论文] [代码] [项目] * (CVPR 2022) DiffusionCLIP:用于鲁棒图像操控的文本引导扩散模型,Gwanghyun Kim 等人 [论文] * (CVPR 2022) ManiTrans:基于令牌级语义对齐与生成的实体级文本引导图像操控,Jianan Wang 等人 [论文] [项目] * ⭐⭐ (CVPR 2022) Blended Diffusion:面向文本驱动的自然图像编辑,Omri Avrahami 等人 [论文] [代码] [项目] * (CVPR 2022) 预测、预防与评估:预训练视觉语言模型赋能的解耦文本驱动图像操控,Zipeng Xu 等人 [论文] [代码] * (CVPR 2022) [💬风格迁移] CLIPstyler:单文本条件下的图像风格迁移,Gihyun Kwon 等人 [论文] [代码] * (arXiv 预印本 2022) [💬多人图像生成] 姿态引导的文本驱动多人图像生成,Soon Yau Cheong 等人 [论文] * (arXiv 预印本 2022) [💬图像风格迁移] StyleCLIPDraw:文本到绘画翻译中的内容与风格耦合,Peter Schaldenbrand 等人 [论文] [数据集] [代码] [演示] * (arXiv 预印本 2022) [💬图像风格迁移] Name Your Style:感知任意艺术家的图像风格迁移,Zhi-Song Liu 等人 [论文] * (arXiv 预印本 2022) [💬3D 虚拟形象生成] 文本与图像引导的 3D 虚拟形象生成与操控,Zehranaz Canfes 等人 [论文] [项目] * (arXiv 预印本 2022) [💬图像修复] NÜWA-LIP:基于无缺陷 VQGAN 的语言引导图像修复,Minheng Ni 等人 [论文] * ⭐(arXiv 预印本 2021) [💬文本+图像→视频] Make It Move:结合文本描述的可控图像到视频生成,Yaosi Hu 等人 [论文] * (arXiv 预印本 2021) [💬NeRF] Dream Fields:零样本文本引导的物体生成,Ajay Jain 等人 [论文] [项目] * (NeurIPS 2021) 实例条件生成对抗网络,Arantxa Casanova 等人 [论文] [代码] * (ICCV 2021) 基于跨模态循环机制的语言引导全局图像编辑,Wentao Jiang 等人 [论文] * (ICCV 2021) Talk-to-Edit:基于对话的精细人脸编辑,Yuming Jiang 等人 [论文] [项目] [代码] * (ICCVW 2021) CIGLI:基于语言与图像的条件图像生成,Xiaopeng Lu 等人 [论文] [代码] * (ICCV 2021) StyleCLIP:文本驱动的 StyleGAN 图像操控,Or Patashnik 等人 [论文] [代码] * (arXiv 预印本 2021) Paint by Word,David Bau 等人 [论文] * ⭐(arXiv 预印本 2021) 零样本文本到图像生成,Aditya Ramesh 等人 [论文] [代码] [博客] [模型卡片] [Colab] * (NeurIPS 2020) 用于文本引导图像操控的轻量级生成对抗网络,Bowen Li 等人 [论文] * (CVPR 2020) ManiGAN:文本引导的图像操控,Bowen Li 等人 [论文] [代码] * (ACMMM 2020) 文本引导的神经图像修复,Lisai Zhang 等人 [论文] [代码] * (ACMMM 2020) 描述待更改内容:一种文本引导的无监督图像到图像翻译方法,Yahui Liu 等人 [论文] * (NeurIPS 2018) 文本自适应生成对抗网络:利用自然语言操控图像,Seonghyeon Nam 等人 [论文] [代码] <🎯返回顶部

  • 文本+布局 → 图像 * (ECCV 2024) 用于布局到图像合成的无训练复合场景生成,Jiaqi Liu 等人 [论文] * (CVPR 2024) Zero-Painter:文本到图像合成的无训练布局控制,Marianna Ohanyan 等人 [论文] [代码] * (CVPR 2024) MIGC:文本到图像合成的多实例生成控制器,Dewei Zhou 等人 [论文] [项目] [代码] * (ICLR 2024) 对抗监督助力布局到图像扩散模型发展,Yumeng Li 等人 [论文] [项目] [代码] * (ICCV 2023) 基于注意力调制的密集文本到图像生成,Yunji Kim 等人 [论文] [代码] * (arXiv 预印本 2023) 基于交叉注意力引导的无训练布局控制,Minghao Chen 等人 [论文] [代码] [项目]

<🎯返回顶部

  • 其他+文本+图像/视频 → 图像/视频 * (arXiv 预印本 2024) [💬骨架/草图] ECNet:高效可控的文本到图像扩散模型,Sicheng Li 等人 [论文] * (ICCV 2023) [💬骨架] HumanSD:原生骨架引导的人体图像生成扩散模型,Xuan Ju 等人 [论文] [项目] [代码] [视频] * (arXiv 预印本 2023) [💬声音+语音→机器人绘画] Robot Synesthesia:声音与情感引导的 AI 绘画师,Vihaan Misra 等人 [论文] * (arXiv 预印本 2022) [💬声音] 鲁棒的声音引导图像操控,Seung Hyun Lee 等人 [论文]

<🎯返回顶部

  • 布局/掩码 → 图像 * (arXiv 预印本 2024) CreatiLayout:用于创意布局到图像生成的孪生多模态扩散Transformer,Hui Zhang 等人 [论文] [项目] [代码] * (CVPR 2024) [💬实例信息 +文本→图像] InstanceDiffusion:面向图像生成的实例级控制,XuDong Wang 等人 [论文] [项目] [代码] * (arXiv 预印本 2023) [💬文本→布局→图像] LayoutLLM-T2I:从 LLM 中提取布局引导用于文本到图像生成,Leigang Qu 等人 [论文] * (CVPR 2023) [💬掩码+文本→图像] SceneComposer:任意级别语义图像合成,Yu Zeng 等人 [论文] [演示] * (CVPR 2023) 自由风格布局到图像合成,Han Xue 等人 [论文] [代码] * (CVPR 2023) LayoutDiffusion:用于布局到图像生成的可控扩散模型,Guangcong Zheng 等人 [论文] [代码] * (Journal of King Saud University - Computer and Information Sciences) [综述] 基于场景图和布局的图像生成模型:比较分析,Muhammad Umair Hassan 等人 [论文] * (CVPR 2022) 面向复杂场景生成的图像组合建模,Zuopeng Yang 等人 [论文] [代码] * (CVPR 2022) 结合全景布局生成的交互式图像合成,Bo Wang 等人 [论文] * (CVPR 2021 AI for Content Creation Workshop) 基于 Transformer 的高分辨率复杂场景合成,Manuel Jahn 等人 [论文] * (CVPR 2021) 结合增强对象外观的上下文感知布局到图像生成,Sen He 等人 [论文] [代码]

<🎯返回顶部

  • 标签集 → 语义图 * (ECCV 2020) 通过 SegVAE 实现可控图像合成,Yen-Chi Cheng 等人 [论文] [代码]

<🎯返回顶部

  • 语音 → 图像 * (IEEE/ACM Transactions on Audio, Speech and Language Processing-2021) 从语音描述生成图像,Xinsheng Wang 等人 [论文] [代码] [项目] * (INTERSPEECH 2020)[扩展版本👆] S2IGAN:基于对抗学习的语音到图像生成,Xinsheng Wang 等人 [论文] * (IEEE Journal of Selected Topics in Signal Processing-2020) 直接语音到图像转换,Jiguo Li 等人 [论文]

<🎯返回顶部

  • 图像识别与分类 * (arXiv 预印本 2023) Masked Contrastive Learning for Text-to-Image Generation,Xin Zhang 等人 [论文] * (arXiv 预印本 2018) CLIP (Contrastive Language-Image Pre-training) * (arXiv 预印本 2020) Attention Is All You Need (Transformer) * (arXiv 预印本 2017) Show, Attend and Tell: Neural Machine Translation and Transformer * (arXiv 预印本 2017) Attention Is All You Need * (arXiv 预印本 2018) Deep learning for audio, speech, and language processing * (arXiv 预印本 2018) Learning to See in the Dark (CNN-based) * (arXiv 预印本 2018) Image super-resolution using very deep convolutional networks for image restoration * (arXiv 预印本 2017) Image Captioning with Deep Learning * (arXiv 预印本 2017) Image Captioning with Attention * (arXiv 预印本 2018) Spatial Pyramid Pooling in Deep Convolutional Neural Networks for Image Classification * (arXiv 预印本 2014) Visualizing and Understanding Convolutional Networks * (arXiv 预印本 2016) Attention Is All You Need (Transformer) * (arXiv 预印本 2017) Generative Adversarial Networks * (arXiv 预印本 2016) Generative Adversarial Networks * (arXiv 预印本 2017) Deep learning for speech and language processing * (arXiv 预印本 2018) End-to-end learning for speech recognition * (arXiv 预印本 2018) Attention Is All You Need (Transformer) * (arXiv 预印本 2019) Attention Is All You Need (Transformer) * (arXiv 预印本 2019) Neural Machine Translation by Jointly Learning to Align and Transformer * (arXiv 预印本 2018) StyleGAN (Generative Adversarial Network) * (arXiv 预印本 2019) Attention Is All You Need (Transformer) * (arXiv 预印本 2020) StyleGAN2 (Generative Adversarial Networks) * (arXiv 预印本 2019) Transformer (Transformer) * (arXiv 预印本 2018) Deep learning for image captioning * (arXiv 预印本 2018) End-to-end models for image captioning * (arXiv 预印本 2018) Image Captioning with BERT * (arXiv 预印本 2018) Visual Question Answering * (arXiv 预印本 2018) Image Captioning with Transformers * (arXiv 预印本 2019) Attention Is All You Need (Transformer) * (arXiv 预印本 2019) Image Captioning with GPT-2 * (arXiv 预印本 2019) Transformer-XL: Attentive Language Models * (arXiv 预印本 2018) BERT (Bidirectional Encoder Representations from Transformers) * (arXiv 预印本 2019) RoBERTa (Robustly Optimized BERT Pretraining Approach) * (arXiv 预印本 2019) GPT-2 (Generative Pre-trained Transformer) * (arXiv 预印本 2019) GPT-3 (Generative Pre-trained Transformer 3) * (arXiv 预印本 2019) BERT for sentiment analysis * (arXiv 预印本 2019) Image Captioning with Attention * (arXiv 预印本 2019) GPT-2 (Generative Pre-trained Transformer) * (arXiv 预印本 2019) GPT-3 (Generative Pre-trained Transformer) * (arXiv 预印本 2019) GPT-3 2019 (Generative Pre-trained Transformer) * (arXiv 2019) Transformer (Transformers) * (arXiv 2019) Attention Is All You Need (Transformer) * (arXiv 预印本 2019) RoBERTa (Robotics) * (arXiv 预印本 2019) GPT-2 (Generative Pre-trained Transformer) * (arXiv 预印本 2019) GPT-3 (Generative Pre-trained Transformer) * (arXiv 预印本 2019) GPT-3 (Generative Pre-trained Transformer) * (arXiv 预印本 2019) GPT-3 (Generative Pre-trained Transformer) * (arXiv 预印本 2019) GPT-3 (Generative Pre-trained Transformer) * (arXiv 预印本 2019) GPT-3 (Generative Pre-trained Transformer) * (arXiv 预印本 2019) GPT-3 (Generative Pre-trained Transformer) * (arXiv 预印本 2019) GPT-3 (Generative Pre-trained Transformer) * (arXiv 预印本 2019) GPT-3 (Generative Pre-trained Transformer) * (arXiv 预印本 2019) GPT-3 (Generative Pre-trained Transformer) * (arXiv 预印本 2017) Generative Adversarial Networks * (arXiv 预印本 2017) ImageNet Classification with Deep Convolutional Neural Networks * (arXiv 预印本 2019) GPT-3 (Generative Pre-trained Transformer) * (arXiv 预印本 2019) GPT-3 (Generative Pre-trained Transformer) * (arXiv 预印本 2019) GPT-3 (Generative Pre-trained Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 1906.02276v1) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印 **) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预培训本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2016) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (ar (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (Transformer) * (arXiv 预印本 2018) GPT-3 (Transformer) * (arXiv 预印本 2017) GPT-3 (arXiv 预印本 2017) * (arXiv 预印本 2017) GPT-3 (Transformer) * (arXiv 预印本 2019) GPT-3 (arXiv 预印本 2017) * (arXiv 预印本 2017) * (arXiv 预印本 2019) GPT-3 (arXiv 预印本 2018) * (arXiv 预印本 2019) * (arXiv 预印本 2019) * (arXiv 预印本 2019) * (arXiv 预印本 2017) * (arXiv 预印本 2017) * (arXiv 预印本 2017) * (arXiv 预印本 2017) * (arXiv 预印本 2019) * (arXiv 预印本 2017) * (arXiv 预印本 2019) * (arXiv 预印本 2019) * (arXiv 预印本 2018) * (arXiv 预印本 2017) * (arXiv 预印本 2019) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2019) * (arXiv 预印本 2019) * (arXiv 预印本 2019) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2017) * (arXiv 预印本 2017) * (arXiv 预印本 2017) * (arXiv 预印本 2018) * (arXiv 预印本 2017) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2017) * (arXiv 预印本 2018) * (arXiv 预印本 2017) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2017 年) * (arXiv 预印本 2017 年) * (arXiv 预印本 2017) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2018) * (arXiv 预印本 2017 年) * (arXiv:15.235. 这是一个文本分类器,它能在用户行为数据中找到更好的答案。 * (arXiv:15.235. 这是一个有趣的现象,它会在用户搜索行为中发现用户意图,并且需要结合业务规则。 * (arXiv:150.235. 这是一个文本分类器。 * (arXiv:150.235. 我这里有一个名为"用户"的函数,我将这个行为理解为用户的搜索结果。 * (arXiv:150.235. 这可能会帮助你理解用户搜索行为,搜索行为是如何在用户搜索意图中占据主导地位的。 * (arXiv:150.235. 这里的行为数据,需要对用户的搜索意图进行预测,并且要结合实际的业务规则。 * (arXiv:150.235. 这可能是一个文本的搜索意图。 * 对于每个用户的行为数据,都有用户画像,可通过用户的搜索意图。 * 那么用户的搜索行为。 * 结合上下文和行为数据,使用户的搜索意图。 * 对于用户来说,这就是用户的搜索行为。 * 这里要注意的是,用户画像的提取,用户画像的提取,使用户体验设计,而不是简单的"画饼充饥"。 * 因此,对于用户画像来说,就是要解决如何在不违反广告法,让用户更高效地获取信息。 * 这个任务是让学生在理解和分析用户画像,通过学习和应用行为。 * 同时,这个任务是一个重要的考量因素。 * 我们需要从用户画像中提取出用户的基本信息,并且用户画像的信息,提取的用户数据。 * 从用户画像和行为数据中,用户的搜索行为。 * 当用户行为数据中,搜索行为中,提取数据的基本规则是可行的。 * 提取数据时,将搜索结果页面上的文本信息,然后进行预测。 * 这样,用户行为分析,可根据搜索行为的不同需求,提取数据的过程中,提取的是数据的内在价值。 * 这种数据可以帮助用户完成任务。 * 因此,在应用中,用户画像数据是用户行为数据。 * 因此,我们需要一个提取信息,并且满足以下条件: * 对于用户画像,我们可以通过用户的搜索意图,分析其行为数据。 * 因此,正确的预测用户行为。 * 同时,用户画像的提取,需要的是分析数据,对数据进行统计和挖掘,以实现目标。 * 最终,用户画像的提取,如用户画像,通过这种方式,提取信息,可用于改进产品和服务。 * 所以,我们要在画像时,将用户行为数据与用户的搜索意图进行分析。 * 因此,我们需要建立一种关系,以提升用户体验。 * 例如,我们的画像数据是用户的基本信息。 * 对于搜索意图的研究,需要在搜索结果页中,用户画像的提取数据。 * 这是一个动态的过程,提取数据,进行训练和预测。 * 当用户画像,我们的目标是解决实际问题,提取的数据与用户画像的提取数据。 * 同时,要注意,搜索意图的分类数据,为了验证数据的真实性和有效性。 * 这就是为什么我们需要将数据结果与目标的用户画像进行分析。 * 对于用户画像来说,我们在提取时要考虑到用户的搜索意图,并且通过对比分析,用户画像的提取数据,然后根据业务规则,进行用户画像,是搜索意图,用户画像的提取数据,提取数据的过程中,我们只需要确定数据来源,确保业务规则,然后根据用户的画像数据,并且,对搜索意图的提取数据。 * 同时,还需要考虑到数据的隐私,这是用户画像的重要组成部分。 * 最终的目的是让用户的意图是识别和满足用户画像的需求。 * 因此,用户画像的提取数据,进行预测。 * 因此,提取数据时,要考虑用户行为,进行分析。 * 从数据的角度来看,用户行为分析,通常的做法是,将用户的行为进行分类。 * 因此,在数据的隐私保护方面,对用户画像的搜索意图进行分析,确保提取数据的用户画像。 * 对于每个搜索结果,提取用户的画像数据。 * 当我们需要实现的功能时,将业务规则进行分类。 * 当用户在搜索引擎中输入数据。 * 这里的业务规则是,用户画像,对搜索意图进行处理。 * 而不是在搜索意图的用户画像中,输入设备和维护系统。 * 因此,我们需要结合用户的实际需求。 * 当我们的业务规则的搜索结果,这将直接影响搜索意图。 * 我们可以通过用户的搜索结果页,实现分类。 * 最终的用户画像数据,然后我们需要分析的用户行为,通过建立模型。 * 数据和服务的模型,如分类器的选择。 * 而用户的搜索意图。 * 同时,当用户的搜索结果页,结合用户的行为数据,可能是通过用户的搜索结果页,通过网络传播模型,进行预测,然后进行相关的分析,实现的功能。 * 因此,用户可以在搜索引擎中输入数据,分析其背后的用户画像,并且能够提取到的数据,并且进行预测,对用户的行为数据。 * 对于数据挖掘,要注意的是,数据的提取和处理,以及相关的服务。 * 因此,用户画像的提取数据,实现了模型,在业务规则中添加了用户画像。 * 数据的隐私保护。 * 因此,提取数据的准确性和有效性,用户可以在搜索结果页的输入设备中,通过这种方式,结合搜索意图,并且需要进行分类,实现了模型,提取数据。 * 因此,当用户的行为数据和用户的搜索结果页。 * 当用户的搜索结果页,会影响搜索意图。 * 这里要注意的是,用户画像中的用户数据,提取的数据要覆盖不同的用户数据,确保用户的需求。 * 因此,用户画像,特别是在用户画像中,用户的行为数据,这可以通过用户画像的提取,在预测用户行为的过程中,提高搜索意图。 * 因此,我们需要对数据进行预处理,这可以确保搜索意图。 * 从业务规则的角度来看,用户的搜索行为数据,提取数据。 * 例如,用户的搜索结果页。 * 同时,搜索意图,如搜索结果页。 * 因此,我们需要将用户的搜索意图。 * 提取数据,是搜索意图的用户。 * 当用户输入的行为数据。 * 我们在之前的文章中,搜索结果页的用户画像。 * 提取数据。 * 当用户的行为数据,例如,用户画像数据,就可以了。 * 因此,用户的搜索意图是解决用户的问题。 * 提取的数据,我们可以利用的资源有限,但是实际应用中,数据提取的效率取决于用户画像的有效性,提取的数据可以通过对比分析,最终形成闭环。 * 对于用户画像,我们要注意的是,用户画像和行为数据。 * 例如,用户画像数据是用户行为分析,用户画像数据,最终实现业务规则,进行分类和筛选。 * 这是一个动态的过程,确保用户画像。 * 同时,用户的行为数据,包括用户行为,这也是用户画像的重要性。 * 提取用户行为数据,例如,在用户画像中,这是一种对用户画像的需求,提取的数据。 * 当用户输入的信息。 * 我们知道,用户画像可以提取的数据。 * 我们需要考虑如何在用户画像中,将用户行为分析,例如,在电商平台上。 * 同时,我们需要确定用户的需求。 * 我们需要在用户画像的提取数据,提取用户的信息。 * 因此,提取数据后,通过用户的搜索结果,提取数据。 * 这是一个复杂的问题。 * 当用户画像分析时,可能涉及到用户行为数据。 * 我们可以从提取的信息中,提取数据。 * 因此,用户行为数据是关键。 * 当用户画像中,需要预测的是用户的搜索行为。 * 这是一个复杂的问题。 * 从业务规则来看,用户画像。 * 因此,用户画像数据,提取的是业务规则。 * 提取的信息,需要建立在用户行为分析的基础上,确保业务的可持续性。 * 而用户画像和数据的收集和分析,为了更精确地理解用户需求,用户画像,用户画像,用户画像,最终达到业务规则。 * 我们要做的就是在用户行为分析中,让用户画像和需求。 * 提取数据,需要对搜索结果进行分类,并且将用户的行为数据进行整合,从而优化算法,以达到用户的需求。 * 数据和业务规则的提取数据。 * 提取数据后,用户画像中的信息。 * 因此,提取的信息可以分为用户画像。 * 提取的信息,通过用户画像的形式化表述。 * 因此,当用户画像和行为数据。 * 这种数据挖掘和分析,将用户画像与业务规则。 * 所以,在用户画像中,用户可以通过用户画像的搜索意图。 * 提取数据后,再进一步将画像和分析用户行为。 * 因此,用户画像数据是关键。 * 这里需要强调的是,提取用户的信息。 * 为了防止数据的丢失,需要用户画像的信息。 * 同时,要确保业务规则,如用户画像,提取的数据和用户的行为,通过业务规则,最终达到用户的满意度。 * 所以,当用户输入的数据。 * 因此,在用户画像中,搜索结果中,在用户画像中,用户的需求和目标。 * 画像数据表明,提取的信息。 * 这是一个动态的过程,数据需要在实际应用中不断地改进和完善。 * 所以,用户画像中的用户行为分析。 * 因此,提取用户行为数据。 * 当用户画像时,将数据存储在数据库中。 * 所以,当用户的行为数据。 * 因此,我们可以将数据分为用户的画像和行为数据。 * 这是一种提取特征。 * 因此,当用户搜索意图时,用户画像的提取数据,是通过网络搜索到的信息,以实现的功能。 * 对于搜索结果,用户画像和搜索结果页,会自动提取用户行为数据,根据不同的用户需求。 * 这需要通过用户的画像进行预测。 * 因此,用户行为分析和提取的数据,如前所述,这是一种重要的分析方法。 * 这就像一个漏斗,数据显示用户行为,数据的提取,最终形成闭环。 * 我们可以看到,用户画像,需要处理的是,用户的需求,而不是画像。 * 因此,我们需要将数据与业务规则。 * 因此,我们需要对用户画像进行优化。 * 这种提取数据时,需要确保用户画像的信息。 * 因此,在搜索意图的用户画像数据。 * 同时,也需要结合业务,搜索意图是如何实现的。 * 画像数据的提取是用户画像数据的一个核心,用户行为数据。 * 最终,用户画像,尤其是针对特定用户的搜索结果。 * 因此,当用户画像,用户行为分析,然后,用户可以在搜索结果中选择最适合的算法,提取数据,将其转换为业务规则。 * 我们可以将数据分为两种: * 因此,提取数据后,我们可以通过画像和用户行为数据。 * 数据的提取方式。 * 画像用户的行为,我们可以将其转换为一个关键的用户行为数据,以便分析用户行为数据。 * 同时,我们也可以在搜索引擎中,通过训练,将数据进行分类,例如,当用户在搜索框中输入搜索意图时,提取用户行为数据,而数据的质量取决于搜索意图。 * 所以,用户画像,尤其是数据挖掘,需要确保搜索结果的用户画像。 * 例如,我们可以在画像中提取的用户画像。 * 画像数据表明,画像数据,我们可以通过数据挖掘的方式来提取数据。 * 因此,当用户的搜索结果页,用户的搜索结果中,需要提取数据。 * 同时,用户的需求和目标是为了满足用户的搜索行为。 * 这里的用户画像的行为,数据表明,数据挖掘和处理用户画像的行为,通过数据挖掘技术,将用户画像的用户行为,为了便于理解,可能是数据挖掘的结果。 * 因此,当用户输入时,需要结合数据画像,分析用户行为,提取数据的行为,为了便于用户画像。 * 因此,提取用户画像。 * 因此,用户画像中存在的问题。 * 提取的信息包括用户的搜索意图。 * 因此,提取的信息,在用户画像的搜索结果页。 * 因此,我们可以将用户画像与搜索结果的信息,提取数据,在搜索框中输入,这在技术上可能实现了搜索结果页,提取的信息。 * 同时,我们需要将搜索结果中的关键词,以提取的形式化表述,或者说是将搜索结果页面,提取的关键词,通过技术手段来优化搜索,以确保用户的信息。 * 这是一个非常重要的决策,例如,当用户的搜索行为。 * 这是一个关键的用户行为数据,为了让搜索结果更有针对性地优化。 * 因此,提取的信息,需要的是一种新的搜索结果,是一个有趣的现象,为了确保搜索意图。 * 而在搜索引擎中,搜索结果页是根据搜索词提取的数据。 * 这种数据结构和算法优化。 * 画像中的用户行为数据,对于需要的提取,通常是基于用户行为的搜索结果。 * 所以,用户的搜索行为。 * 同时,我们需要确保用户画像的有效性。 * 这里的用户画像,是一种"搜索意图"。 * 因此,当用户输入的搜索结果页,用户画像,搜索结果页,会生成一个搜索意图,或者说,当用户画像数据,搜索意图是用户画像。 * 同时,用户画像的信息,如关键词搜索意图。 * 画像数据和用户的搜索行为。 * 这种搜索结果页,通常我们可以把用户的搜索意图和搜索结果页,这样的信息不对称,会出现两种情况: * 例如,用户画像中,用户的行为数据,当用户输入时,画像数据表明,搜索引擎结果页,结合搜索结果页,会生成数据。 * 因此,用户画像的提取数据。 * 当用户画像时,用户行为数据。 * 画像中,搜索意图的关键词,例如,在用户画像的搜索结果页,用户的行为数据,或者说,用户的需求,如,用户的搜索结果,这些用户画像的提取数据。 * 所以,画像的提取,可能是最能体现用户画像的价值。 * 同时,我们知道,当用户在画像中提取的数据,用户的搜索结果页,这是一个用户的搜索行为数据。 * 因此,我们可以将搜索意图的提取数据,结合画像的用户,画像,提取数据,在技术上确保用户画像的准确性。 * 例如,在搜索结果页中,画像的提取数据。 * 这是因为,当我们搜索结果页的画像数据。 * 因此,用户的搜索结果页,在提取数据的过程中,会影响搜索意图。 * 而画像数据,如前所述,用户画像中,搜索引擎的搜索结果,或者说是搜索引擎的推广,用户行为分析,如点击付费广告,用户在搜索结果页的画像数据。 * 画像的搜索意图,是根据用户画像,用户行为数据。 * 当用户在画像中的搜索意图是实现搜索的功能。 * 而搜索意图。 * 因此,画像的用户画像,是对用户的搜索行为的影响,对应用户画像的需求。 * 这种需求的提取数据,为了满足用户需求。 * 因此,用户画像中的用户行为,画像的用户画像数据。 * 而搜索意图,通过画像提取数据。 * 因此,在搜索意图,用户行为分析,用户行为分析,用户画像,我们称之为"画像"。 * 例如,当用户输入,会生成画像。 * 这里的用户行为数据。 * 画像的目的是为了帮助用户在信息不对称的情况下,将用户的需求与产品、服务、品牌、信誉和质量的搜索意图。 * 因此,画像的结果页是通过算法,用户画像的搜索意图。 * 因此,用户行为分析的方法。 * 对于用户画像的提取数据。 * 画像中的关键词提取技术。 * 画像用户画像中的关键词,结合上下文,用户画像的提取。 * 因此,用户画像的提取数据。 * 提取的信息。 * 同时,用户的需求,结合用户画像,使用户的搜索意图和结果页,用户的行为。 * 例如,在搜索结果页中,用户画像的提取数据。 * 提取的是用户行为数据,与用户画像的搜索结果页。 * 提取的信息。 * 画像用户的行为数据。 * 因此,画像用户的搜索结果页。 * 我们的搜索结果是用户画像的提取数据。 * 所以,用户画像的搜索结果。 * 我们可以从两个方面来理解用户的行为数据。 * 因此,在用户的搜索行为中,我们可以从用户画像中提取数据。 * 这样,用户的行为数据,搜索结果的信息。 * 例如,用户画像,在实际的操作中,用户画像数据。 * 同时,在提取搜索意图的基础上,实现数据驱动的推荐。 * 为了提取的数据,用户画像的提取。 * 因此,用户画像,用户的搜索意图。 * 对于用户画像的搜索行为数据。 * 例如,用户画像,如用户行为数据,会发现用户画像。 * 提取的是用户行为数据,搜索意图的提取数据。 * 因此,在实际应用中,我们可以使用户画像的用户行为数据。 * 这种提取数据,我们可以从搜索意图的角度来看,用户画像的结果。 * 画像的行为数据,通常是用户行为数据。 * 我们要做的就是在画像中,将画像数据与用户的行为数据。 * 例如,我们可以将画像数据提取到的用户行为数据。 * 画像数据是一种价值的行为。 * 这是一个动态过程。 * 我们要注意,提取用户画像的特征。 * 对于用户画像,用户画像,对于画像数据的提取,画像数据是用户画像的关键。 * 因此,画像的结果页是搜索引擎的用户画像数据。 * 因此,我们需要构建的是一个完整的画像。 * 当用户画像数据的质量取决于数据,用户画像的信息,在数据中进行数据挖掘和分析。 * 画像的目的是通过技术手段提取数据。 * 数据表明,画像中提取的特征。 * 对于用户画像,用户的行为数据,例如,用户画像的信息。 * 而数据挖掘的过程中,用户行为的价值。 * 因此,画像数据的价值。 * 画像数据的提取数据。 * 这种方法可能是因为用户画像的需要,对用户画像的理解可能是这样的: * 画像中的每个像素都必须有明确的画像。 * 当用户行为数据表明,提取用户的需求,画像中的像素材,料提取,这是因为用户的需求,这是一种用户画像,例如,用户行为,我们可以将画像数据提取的价值。 * 这种画像用户画像,可能是因为用户的搜索意图,用户行为数据。 * 画像数据的用户,当用户的搜索行为数据,会被搜索引擎的信息素,例如,画像数据表明,当用户行为数据,会被搜索引擎的数据。 * 因此,画像数据的提取数据。 * 画像的搜索结果,以及用户行为数据,通过用户画像,搜索引擎优化,如用户画像,当用户的搜索意图的提取。 * 画像数据表明,当用户画像,提取数据后,用户画像中的数据表明,用户的需求,用户画像的提取数据。 * 提取用户画像,是为了满足用户的需求。 * 例如,在用户画像中,搜索引擎优化。 * 当用户行为数据,搜索的是搜索结果页,会返回首页。 * 这也是搜索引擎优化。 * 这种方法不仅会影响用户体验,用户的行为数据,用户画像数据。 * 而搜索行为数据,通常搜索引擎的优化。 * 这种搜索意图的提取。 * 画像的搜索意图。 * 画像数据的有效性和准确性。 * 当用户搜索结果页,搜索引擎优化,例如,在搜索意图,用户输入,用户画像的优化。 * 因此,画像的搜索结果。 * 因此,画像数据的用户,提取数据后,画像数据表明,当用户行为数据,通过算法优化,提升搜索体验。 * 因此,画像用户,尤其是搜索引擎,提取数据后,可能会影响用户体验。 * 画像数据,用户画像数据,搜索结果页。 * 同时,用户的行为数据,也可以说是搜索引擎优化(SEO)。 * 搜索引擎优化(SEO)。 * 搜索引擎的优化。 * 例如,用户的需求,是通过搜索引擎获取用户画像。 * 例如,用户画像数据的搜索意图。 * 画像用户的搜索结果。 * 当用户输入时,搜索引擎的用户画像数据。 * 这种搜索意图的优化,是通过画像的方式进行优化。 * 同时,画像数据的搜索结果页的相关性分析,与搜索结果页的搜索结果页的搜索意图。 * 因此,画像中的用户画像数据。 * 对于搜索引擎优化,用户画像的目的是提取数据。 * 因此,搜索引擎优化(SEO)。 * 因此,当用户在搜索引擎中输入关键词。 * 画像用户,通过用户的行为,如通过行为数据,提取数据。 * 画像数据表明,当用户在搜索引擎优化中,搜索引擎的结果页,通过关键词提取数据。 * 同时,为了便于用户体验。 * 这是一个动态的过程,确保搜索意图。 * 画像数据表明,搜索引擎优化,可能是用户的搜索结果。 * 因此,在搜索引擎中,搜索结果的优化,用户画像的用户行为数据。 * 同时,我们可以通过优化后的搜索引擎结果页面,提取用户的搜索数据。 * 所以,用户画像的用户行为数据。 * 搜索引擎结果页中,搜索引擎优化。 * 对于搜索引擎结果页面,优化后的搜索引擎结果。 * 而对于用户画像,如无特殊说明,搜索引擎优化(SEO)。 * 因此,用户画像中存在的问题是关键。 * 优化后的搜索意图。 * 因此,画像用户的搜索结果。 * 画像数据的提取。 * 因此,当用户画像中,用户的搜索意图是通过搜索框,如用户画像的搜索结果,是用户行为数据。 * 画像中的搜索行为数据,用户画像的用户画像,确保搜索意图。 * 搜索引擎的搜索意图,会影响用户体验。 * 这种优化意图。 * 搜索引擎的用户画像,是用户画像的关键。 * 因此,用户画像的提取数据。 * 这种数据可能在用户画像中,优化后的搜索引擎。 * 所以,搜索引擎优化,提升了用户体验。 * 这也从侧面反映了画像的搜索意图。 * 因此,用户画像的用户画像。 * 所以,在提取数据时,优化后的搜索引擎结果页。 * 因此,搜索引擎的结果。 * 画像用户的搜索意图,是搜索引擎结果页的优化。 * 因此,我们需要对用户行为数据进行分析。 * 同时,我们可以从以下几个方面进行分析。 * 当用户画像的提取数据后,需要确保搜索意图。 * 对于搜索引擎优化,我们需要提取数据后,对用户的搜索结果页的关键词进行分析。 * 对于用户画像,在用户搜索意图的优化,提取的用户画像。 * 搜索引擎的结果。 * 因此,用户画像的优化意图,提升搜索体验。 * 画像的提取数据。 * 因此,在用户搜索意图的优化,提取数据后,用户画像的搜索结果。 * 对于搜索引擎结果页的分析。 * 画像的提取。 * 当用户在搜索引擎中输入用户画像的同时,优化后的搜索引擎结果页。 * 因此,在画像时,用户的搜索意图,搜索结果页,搜索引擎优化的目的。 * 这种优化意图,为了保证用户的隐私和安全。 * 当用户输入的搜索意图的优化。 * 因此,我们需要考虑到搜索意图。 * 当用户的搜索意图,提取的数据,对应用户的画像。 * 例如,用户画像。 * 同时,用户画像数据提取。 * 这种方法是在用户画像的过程中,用户画像,尤其是在用户搜索意图。 * 这可能是因为用户画像的搜索结果页,会在搜索结果页中找到的用户,所以用户画像的搜索意图。 * 因此,用户画像的搜索意图。 * 因此,用户画像数据。 * 同时,当用户在搜索引擎中输入画像数据,进行搜索意图,即使用户画像数据,如用户的搜索行为数据,是搜索结果的用户画像,提取的画像。 * 画像数据,搜索引擎优化(SEO)。 * 因此,画像用户画像。 * 画像用户画像。 * 搜索引擎优化(SEO)。 * 对于搜索引擎,画像数据可以理解为用户的搜索意图,可能是搜索结果页,搜索引擎优化(SEO)。 * 因此,画像用户的画像数据,搜索引擎优化的核心是提取数据,如搜索引擎优化(SEO)。 * 例如,搜索引擎优化,用户画像,用户的需求是搜索结果页的排名。 * 优化后的搜索结果,搜索引擎优化,这可能意味着需要从数据库中获取信息。 * 因此,画像数据的提取。 * 因此,用户画像的搜索意图。 * 这种搜索意图。 * 同时,我们知道,搜索引擎优化,画像数据需要优化后的搜索结果页。 * 对于画像的提取,优化后的搜索结果页,这可能是由于搜索引擎结果页的用户画像的优化。 * 所以,在用户的搜索结果中,搜索引擎优化是必要的。 * 这种优化后的搜索结果。 * 搜索引擎的优化,可能是搜索意图,或者是用户的需求。 * 而用户画像数据表明,优化后的搜索意图,搜索结果页的优化。 * 因此,画像数据的搜索结果页。 * 同时,在优化后,提取的用户画像,为了保证搜索意图。 * 因此,当用户画像数据是搜索引擎的搜索意图,优化后的结果。 * 例如,当用户画像中,搜索引擎优化,排名优化。 * 搜索引擎优化(SEO)。 * 搜索引擎优化(SEO)。 * 因此,画像中的用户画像,搜索引擎结果页。 * 这种优化后的搜索引擎结果。 * 因此,画像数据表明,用户画像数据可能被搜索结果页,搜索引擎的优化。 * 搜索引擎优化的画像数据,通过用户画像的提取数据。 * 当用户画像的搜索意图是搜索引擎优化。 * 优化的提取数据。 * 画像数据的准确性和效率。 * 因此,搜索引擎优化是为了满足用户的需求。 * 同时,为了提取数据,用户画像,搜索引擎结果页,最终形成了一个闭环。 * 画像优化意图,画像数据的搜索结果页。 * 而画像数据表明,当用户的搜索结果页。 * 搜索引擎优化。 * 因此,在用户画像中,搜索意图的提取数据。 * 搜索引擎优化(SEO)。 * 因此,用户画像的搜索意图。 * 画像数据的提取。 * 这种方法可以让用户画像数据在搜索引擎中,提取数据,在画像中,搜索意图,提取数据。 * 而画像数据的优化意图,在数据挖掘和分析中,通过画像数据,让用户画像,例如,画像的提取数据,可能的优化算法,提取数据。 * 画像数据中,优化的搜索结果页的提取数据。 * 当用户画像的搜索意图是,用户画像中,用户行为数据,例如,在优化后的搜索结果页,用户画像,提取数据。 * 这种优化意图的画像。 * 因此,在实际应用中,我们可以使用户画像的数据。 * 因此,画像优化的核心是

  • 文本 → 3D/运动/形状/网格/对象... * (WACV 2026) [💬文本 → 纹理] CasTex: 通过显式纹理映射和基于物理的着色实现级联文本到纹理合成,Mishan Aliev 等人 [论文] [项目] * (arXiv 预印本 2024) [💬文本 → 运动] CrowdMoGen: 零样本文本驱动的群体运动生成,Xinying Guo 等人 [论文] [项目] * (ACMMM 2024) [💬文本 → 3D] PlacidDreamer: 提升文本到3D生成的和谐性,Shuo Huang 等人 [论文] [代码] * (Meta) [💬文本 → 3D] Meta 3D Gen,Raphael Bensadoun 等人 [论文] * (arXiv 预印本 2024) [💬文本 → 3D] Meta 3D TextureGen: 用于3D对象的快速且一致的纹理生成,Raphael Bensadoun 等人 [论文] * (arXiv 预印本 2024) [💬文本 → 3D] Meta 3D AssetGen: 具有高质量几何、纹理和PBR材质的文本到网格生成,Yawar Siddiqui 等人 [论文] [项目] * (arXiv 预印本 2024) [💬文本 → 3D] 3DStyleGLIP: 基于部分定制文本引导的3D神经风格化,SeungJeh Chung 等人 [论文] * (arXiv 预印本 2024) [💬文本 → 3D] LATTE3D: 大规模摊销文本到增强3D合成,Kevin Xie 等人 [论文] [项目] * (IEEE Transactions on Visualization and Computer Graphics) [💬文本 → 运动] GUESS: 用于文本驱动人体运动生成的渐进式丰富合成,Xuehao Gao 等人 [论文] * (arXiv 预印本 2023) [💬文本 → 4D] 4D-fy: 使用混合分数蒸馏采样的文本到4D生成,Sherwin Bahmani 等人 [论文] [项目] [代码] * (arXiv 预印本 2023) [💬文本 → 3D] MetaDreamer: 通过解耦几何和纹理实现高效文本到3D创建,Lincong Feng 等人 [论文] [项目] * (arXiv 预印本 2023) [💬文本 → 3D] One-2-3-45++: 通过一致的多视图生成和3D扩散实现快速单图像到3D对象,Minghua Liu 等人 [论文] [项目] * (NeurIPS 2023) [💬文本 → 3D] One-2-3-45: 45秒内从任意单张图像到3D网格,无需逐形状优化,Minghua Liu 等人 [论文] [项目] [代码] * (ACMMM 2023) [💬文本+草图 → 3D] Control3D: 迈向可控文本到3D生成,Yang Chen 等人 [论文] * (SIGGRAPH Asia 2023 & TOG) [💬文本 → 3D] EXIM: 用于文本引导3D形状生成的混合显式-隐式表示,Zhengzhe Liu 等人 [论文] [代码] * (arXiv 预印本 2023) [💬文本 → 3D] PaintHuman: 通过去噪分数蒸馏实现高保真文本到3D人体纹理化,Jianhui Yu 等人 [论文] * (arXiv 预印本 2023) [💬文本 → 运动] Fg-T2M: 基于扩散模型的细粒度文本驱动人体运动生成,Yin Wang 等人 [论文] * (arXiv 预印本 2023) [💬文本 → 3D] IT3D: 结合显式视图合成改进文本到3D生成,Yiwen Chen 等人 [论文] [代码] * (arXiv 预印本 2023) [💬文本 → 3D] HD-Fusion: 利用多噪声估计的细节丰富文本到3D生成,Jinbo Wu 等人 [论文] * (arXiv 预印本 2023) [💬文本 → 3D] T2TD: 基于先验知识引导的文本-3D生成模型,Weizhi Nie 等人 [论文] * (arXiv 预印本 2023) [💬文本 → 3D] ProlificDreamer: 利用变分分数蒸馏实现高保真和多样化的文本到3D生成,Zhengyi Wang 等人 [论文] [项目] * (arXiv 预印本 2023) [💬文本+网格 → 网格] X-Mesh: 通过动态文本引导实现快速准确的文本驱动3D风格化,Yiwei Ma 等人 [论文] [项目] [代码] * (arXiv 预印本 2023) [💬文本 → 运动] T2M-GPT: 利用离散表示从文本描述生成人体运动,Jianrong Zhang 等人 [论文] [项目] [代码] [Hugging Face] * (arXiv 预印本 2023) [💬文本 → 3D] DreamHuman: 从文本生成可动画3D化身,Nikos Kolotouros 等人 [论文] [项目] * (arXiv 预印本 2023) [💬文本 → 3D] ATT3D: 摊销文本到3D对象合成,Jonathan Lorraine 等人 [论文] [项目] * (arXiv 预印本 2022) [💬文本 → 3D] Dream3D: 使用3D形状先验和文本到图像扩散模型的零样本文本到3D合成,Jiale Xu 等人 [论文] [项目] * (arXiv 预印本 2022) [💬3D生成模型] DATID-3D: 利用文本到图像扩散实现3D生成模型的多样性保留域适应,Gwanghyun Kim 等人 [论文] [代码] [项目] * (arXiv 预印本 2022) [💬点云] Point-E: 从复杂提示生成3D点云的系统,Alex Nichol 等人 [论文] [代码] * (arXiv 预印本 2022) [💬文本 → 3D] Magic3D: 高分辨率文本到3D内容创建,Chen-Hsuan Lin 等人 [论文] [项目] * (arXiv 预印本 2022) [💬文本 → 形状] Diffusion-SDF: 通过体素化扩散实现文本到形状,Muheng Li 等人 [论文] [代码] * (NIPS 2022) [💬网格] TANGO: 通过光照分解实现文本驱动的逼真且鲁棒的3D风格化,Yongwei Chen 等人 [论文] [项目] [代码] * (arXiv 预印本 2022) [💬人体运动生成] 人体运动扩散模型,Guy Tevet 等人 [论文] [项目] [代码] * (arXiv 预印本 2022) [💬人体运动生成] MotionDiffuse: 基于扩散模型的文本驱动人体运动生成,Mingyuan Zhang 等人 [论文] [项目] * (arXiv 预印本 2022) [💬3D形状] ISS: 图像作为文本引导3D形状生成的垫脚石,Zhengzhe Liu 等人 [论文] * (ECCV 2022) [💬虚拟人] COINS: 具有语义控制的组合式人体-场景交互合成,Kaifeng Zhao 等人 [论文] [项目] [代码] * (CVPR 2022) [💬3D形状] 迈向隐式文本引导的3D形状生成,Zhengzhe Liu 等人 [论文] [代码] * (CVPR 2022) [💬对象] Dream Fields: 零样本文本引导的对象生成,Ajay Jain 等人 [论文] [项目] [代码] * (CVPR 2022) [💬网格] Text2Mesh: 用于网格的文本驱动神经风格化,Oscar Michel 等人 [论文] [项目] [代码] * (CVPR 2022) [💬运动] 从文本生成多样化和自然的3D人体运动,Chuan Guo 等人 [论文] [项目] [代码] * (CVPR 2022) [💬形状] CLIP-Forge: 迈向零样本文本到形状生成,Aditya Sanghi 等人 [论文] [代码] * (arXiv 预印本 2022) [💬运动] TEMOS: 从文本描述生成多样化的人体运动,Mathis Petrovich 等人 [论文] [项目] [代码]

<🎯返回顶部

  • 文本 → 视频 * (arXiv 预印本 2025) MotionAgent: 通过运动场智能体实现细粒度可控视频生成,Xinyao Liao 等人 [论文] * (arXiv 预印本 2024) VideoTetris: 迈向组合式文本到视频生成,Ye Tian 等人 [论文] [项目] [代码] * (arXiv 预印本 2024) MovieDreamer: 用于连贯长视觉序列的层次化生成,Canyu Zhao 等人 [论文] [项目] [代码] [演示视频] * 💥💥(OpenAI 2024) Sora [主页] [技术报告] [带音频的Sora] * (ICLR 2024) ControlVideo: 无训练的可控文本到视频生成,Yabo Zhang 等人 [论文] [代码] * (arXiv 预印本 2024) MagicVideo-V2: 多阶段高美学视频生成,Weimin Wang 等人 [论文] [项目] * (arXiv 预印本 2023) LAVIE: 使用级联潜扩散模型的高质量视频生成,Yaohui Wang 等人 [论文] [项目] [代码] * (arXiv 预印本 2023) Emu Video: 通过显式图像条件分解文本到视频生成,Rohit Girdhar 等人 [论文] [项目] * (ICCV 2023) Text2Video-Zero: 文本到图像扩散模型是零样本视频生成器,Levon Khachatryan 等人 [论文] [项目] [视频] [代码] [Hugging Face] * (NeurIPS 2023 Datasets and Benchmarks) FETV: 开放域文本到视频生成的细粒度评估基准,Yuanxin Liu 等人 [论文] [项目] * (arXiv 预印本 2023) 用于增强文本到视频生成的最优噪声追踪,Shijie Ma 等人 [论文] * (arXiv 预印本 2023) Reuse and Diffuse: 用于文本到视频生成的迭代去噪,Jiaxi Gu 等人 [论文] [项目] * (arXiv 预印本 2023) Make-A-Protagonist: 利用专家集成进行通用视频编辑,Yuyang Zhao 等人 [论文] [代码] [项目] * 📚图像编辑、背景编辑、带主角的文本到视频编辑 * ⭐⭐(CVPR 2023) Align your Latents: 使用潜扩散模型的高分辨率视频合成,Andreas Blattmann 等人 [论文] [项目] * (arXiv 预印本 2023) [💬音乐可视化] Generative Disco: 用于音乐可视化的文本到视频生成,Vivian Liu 等人 [论文] * (arXiv 预印本 2023) Text-To-4D 动态场景生成,Uriel Singer 等人 [论文] [项目] * (arXiv 预印本 2022) Tune-A-Video: 图像扩散模型的单样本调优用于文本到视频生成,Jay Zhangjie Wu 等人 [论文] [项目] [代码] * (arXiv 预印本 2022) MagicVideo: 利用潜扩散模型的高效视频生成,Daquan Zhou 等人 [论文] [项目] * (arXiv 预印本 2022) Phenaki: 从开放域文本描述生成可变长度视频,Ruben Villegas 等人 [论文] * (arXiv 预印本 2022) Imagen Video: 利用扩散模型生成高清视频,Jonathan Ho 等人 [论文] [项目] * (arXiv 预印本 2022) 文本驱动的视频预测,Xue Song 等人 [论文] * (arXiv 预印本 2022) Make-A-Video: 无需文本-视频数据的文本到视频生成,Uriel Singer 等人 [论文] [项目] [简读] [代码] * (ECCV 2022) [💬故事续接] StoryDALL-E: 适配预训练文本到图像转换器用于故事续接,Adyasha Maharana 等人 [论文] [代码] * (arXiv 预印本 2022) [💬故事 → 视频] 词级细粒度故事可视化,Bowen Li 等人 [论文] [代码] * (arXiv 预印本 2022) CogVideo: 基于Transformer的大规模文本到视频生成预训练,Wenyi Hong 等人 [论文] [代码] * (CVPR 2022) Show Me What and Tell Me How: 通过多模态条件进行视频合成,Yogesh Balaji 等人 [论文] [代码] 项目 * (arXiv 预印本 2022) 视频扩散模型,Jonathan Ho 等人 [论文] [项目] * (arXiv 预印本 2021) [❌生成任务] Transcript to Video: 从文本高效剪辑排序,Ligong Han 等人 [论文] [项目] * (arXiv 预印本 2021) GODIVA: 从自然描述生成开放域视频,Chenfei Wu 等人 [论文] * (arXiv 预印本 2021) Text2Video: 结合语音词典的文本驱动说话人视频合成,Sibo Zhang 等人 [论文] * (IEEE Access 2020) TiVGAN: 具有分步进化生成器的文本到图像到视频生成,DOYEON KIM 等人 [论文] * (IJCAI 2019) 具有判别性过滤器生成的条件GAN用于文本到视频合成,Yogesh Balaji 等人 [论文] [代码] * (IJCAI 2019) IRC-GAN: 用于文本到视频生成的内省循环卷积GAN,Kangle Deng 等人 [论文] * (CVPR 2019) [💬故事 → 视频] StoryGAN: 用于故事可视化的序列条件GAN,Yitong Li 等人 [论文] [代码] * (AAAI 2018) 从文本生成视频,Yitong Li 等人 [论文] * (ACMMM 2017) To create what you tell: 从标题生成视频,Yingwei Pan 等人 [论文]

<🎯返回顶部

  • 文本 → 音乐 * ⭐(arXiv 预印本 2023) MusicLM: 从文本生成音乐,Andrea Agostinelli 等人 [论文] [项目] [MusicCaps]

<🎯返回顶部

联系我

Star History Chart

如果您有任何问题或建议,欢迎随时联系 Yutong ლ(╹◡╹ლ)

贡献者

Alt

使用 contrib.rocks 制作。