# Qwen-Image-2.1, 7B 모델로 투명 배경까지 한 번에

> 알리바바 Qwen이 생성·편집·투명 이미지를 한 모델에 합친 Qwen-Image-2.1을 공개했습니다. 구조와 자체 벤치마크, 한계를 정리합니다.

- 출처 사이트: AI피셜 (https://aifficial.net/posts/qwen-image-2-1-native-transparency/)
- 발행: 2026-09-21
- 카테고리: 모델 · 태그: Qwen, 이미지 생성, 오픈소스, 알리바바, 투명 배경

## 핵심 답변

알리바바 Qwen 팀은 2026년 9월 20일 텍스트-이미지 생성과 이미지 편집을 한 파이프라인에 합친 Qwen-Image-2.1을 공개했습니다. 시각 생성부는 32층 단일 스트림 DiT 70억 매개변수이고, 64채널 RGBA 오토인코더로 배경 제거 단계 없이 알파 채널이 있는 투명 이미지를 직접 만들고 편집합니다. 참조 이미지 최대 10장, 원 표시·마스크 기반 부분 편집, 2K 출력, Diffusers·ComfyUI 등 첫날 지원이 특징이며, 회사 자체 벤치마크 Qwen-Image-Bench에서 60.28점을 보고했습니다.

## 한 장 요약(만화)

![AI피셜 마스코트가 생성과 편집의 통합, 알파 채널 투명 이미지, 참조 10장 편집, 회사 벤치마크 60.28점을 네 컷으로 설명합니다.](https://aifficial.net/images/posts/qwen-image-2-1-native-transparency/comic-v1.0.0.webp)

## 요약

- Qwen-Image-2.1은 생성과 편집을 한 모델에 합쳤고 시각 생성부는 7B 매개변수, 텍스트·이미지 인코더는 Qwen3-VL 8B입니다.
- 64채널 RGBA 오토인코더로 투명 이미지를 프롬프트만으로 생성하고, 투명 레이어의 표정과 글자를 편집하며, 사진에서 피사체를 투명 자산으로 뽑아냅니다.
- 참조 이미지 최대 10장과 원·마스크 표시 부분 편집, 2K 출력, Diffusers·ComfyUI·vLLM-Omni·SGLang 첫날 지원을 갖췄습니다.
- 자체 벤치마크 Qwen-Image-Bench 60.28점은 회사가 낸 값이며, 라이선스는 Qwen Research License입니다.

## 핵심 사실

| 항목 | 값 |
|---|---|
| 공개 | 2026-09-20 (GitHub·Hugging Face·ModelScope에 가중치와 코드가 올라왔습니다.) |
| 시각 생성부 | 7B·32층 DiT (단일 스트림 DiT이며 인코더는 별도 Qwen3-VL 8B입니다.) |
| 투명 이미지 | 64채널 RGBA VAE (16배 공간 압축, 기본 40단계 추론, 정사각 2048×2048 기본 출력입니다.) |
| 자체 벤치마크 | 60.28점 (Qwen-Image-Bench 회사 발표 값이며 Nano Banana 2.0 59.82, GPT Image 1.5 59.65와 비교했습니다.) |


## 생성과 편집을 한 모델로

알리바바의 Qwen 팀은 2026년 9월 20일 Qwen-Image-2.1을 공개했습니다. 텍스트로 이미지를 만드는 기능과 기존 이미지를 편집하는 기능을 한 파이프라인에 합친 모델이며, 가중치와 코드는 GitHub, Hugging Face, ModelScope에 함께 올라왔습니다. 해커뉴스에서는 하루 만에 570점이 넘는 반응을 얻었습니다. 

크기는 작습니다. 시각 생성부는 32층 단일 스트림 DiT(Diffusion Transformer, 확산 모델을 트랜스포머로 구성한 구조)로 70억 매개변수이고, 텍스트와 조건 이미지는 별도의 Qwen3-VL 8B가 읽습니다. 참조 이미지와 편집 지시를 캐시에 두고 매 단계 다시 처리하지 않는 Prefix KV Cache 설계로 여러 장을 참조하는 편집의 비용을 줄였다고 팀은 설명합니다. 

## 배경을 지우지 않고 처음부터 투명하게

가장 눈에 띄는 기능은 투명 이미지 생성입니다. 지금까지 투명 배경 이미지는 보통 일반 이미지를 만든 뒤 배경 제거 도구를 한 번 더 돌려 얻었습니다. Qwen-Image-2.1은 64채널 RGBA 오토인코더를 써서 알파 채널(alpha channel, 픽셀마다 투명도를 담는 정보)을 생성 결과 자체에 포함합니다. 2025년 12월 별도 모델이었던 Qwen-Image-Layered의 기능을 한 모델로 통합한 것입니다. 



공개 예시는 세 갈래입니다. 프롬프트만으로 투명 배경의 캐릭터나 여러 요소가 겹친 구성물을 만들고, 이미 투명한 자산의 표정이나 글자를 배경을 유지한 채 바꾸며, 일반 사진에서 피사체만 투명 자산으로 뽑아냅니다. 저장소는 투명 이미지를 원할 때 “This is an RGBA image with transparency”로 시작하는 프롬프트 형식을 권장합니다. 

## 참조 10장, 원 표시 편집, 2K

편집 쪽도 넓어졌습니다. 참조 이미지를 최대 10장까지 받아 인물, 옷, 신발, 가방 같은 여러 요소를 한 장으로 합칠 수 있고, 원을 그리거나 칠한 표시, 별도 마스크로 고칠 영역을 지정하는 부분 편집을 지원합니다. 출력은 2K이며 기본 추론 단계는 40입니다. Diffusers, ComfyUI, vLLM-Omni, SGLang, LightX2V가 공개 당일 지원을 밝혔습니다. 

| 항목 | Qwen-Image-2.0 | Qwen-Image-2.1 |
| --- | --- | --- |
| 생성+편집 통합 | 지원 | 지원 |
| 투명(RGBA) 생성 | 미지원 | 지원 |
| 참조 이미지 | 제한적 | 최대 10장 |
| 원·마스크 부분 편집 | 제한적 | 지원 |
| 첫날 ComfyUI | 미지원 | 지원 |

## 수치는 회사가 낸 값입니다

팀은 자체 평가 Qwen-Image-Bench에서 60.28점을 보고했고, 같은 표에 Nano Banana 2.0을 59.82점, GPT Image 1.5를 59.65점으로 실었습니다. 평가 문항과 채점 기준을 회사가 만들었으므로 독립 평가와 구분해 읽어야 합니다. 라이선스는 Qwen Research License로 안내됐고, 상업 이용 조건은 원문 확인이 필요합니다. 

7B라는 숫자도 조건이 붙습니다. 이는 시각 생성부만의 크기이고 인코더 Qwen3-VL 8B가 별도로 돕니다. 그럼에도 커뮤니티가 주목한 지점은 크기가 아니라, 생성·편집·투명 출력·다중 참조라는 네 가지 작업을 하나의 작은 파이프라인으로 묶었다는 사실입니다. 


저는 이번 공개에서 점수표보다 알파 채널 한 줄이 더 오래 남습니다. 배경 제거는 디자이너와 쇼핑몰 운영자가 매일 반복하던 잡일이고, 그 단계가 생성 안으로 들어오면 작업 흐름 자체가 바뀌니까요. 참조 10장을 캐시로 처리하는 설계도 같은 방향입니다. 비싼 대형 모델 하나보다 자주 쓰는 작업을 싸게 묶은 모델이 실무에서 더 오래 쓰일 것 같습니다. 다만 60.28점은 회사가 만든 시험지의 점수이고, 라이선스 조건은 아직 읽어 봐야 합니다. 독자님의 작업에서 배경 제거 단계가 사라지면 하루에 몇 분이 돌아올까요. 



## 자주 묻는 질문

**Q. 투명 배경 생성이 왜 중요합니까?**

기존에는 이미지를 만든 뒤 배경 제거 도구를 따로 돌려 투명 PNG를 얻었습니다. 이 모델은 알파 채널을 생성 자체에 포함해 스티커, 제품 컷아웃, 아이콘, 합성용 요소를 한 번에 만듭니다.

**Q. 7B면 어느 정도 장비에서 돌아갑니까?**

발표문은 낮은 추론 비용을 앞세우고 ComfyUI용으로 BF16·INT8·W4A8 인코더 변형을 제공합니다. 다만 7B는 시각 생성부만의 크기이고 인코더 8B가 따로 붙습니다.

**Q. 상업적으로 써도 됩니까?**

라이선스는 Qwen Research License로 안내됐습니다. 상업 이용 조건은 라이선스 원문을 직접 확인해야 합니다.

**Q. 벤치마크 점수는 믿을 만합니까?**

Qwen-Image-Bench는 회사가 만든 평가이고 비교 대상 점수도 회사가 실었습니다. 독립 평가 전까지는 회사 발표 수치로 읽어야 합니다.

## 출처

1. [Qwen-Image-2.1 발표문](https://qwen.ai/blog?id=qwen-image-2.1) (official)
2. [Qwen-Image-2.1 GitHub](https://github.com/QwenLM/Qwen-Image-2.1) (official)
3. [Hugging Face 모델 카드](https://huggingface.co/Qwen/Qwen-Image-2.1) (official)
4. [해커뉴스 토론](https://news.ycombinator.com/item?id=49775499) (other)

_이 문서는 AI피셜 편집부가 작성했습니다. 인용 시 출처를 표기해 주세요._