본문으로 건너뛰기

Qwen-Image-2.1, 7B 모델로 투명 배경까지 한 번에

알리바바 Qwen이 생성·편집·투명 이미지를 한 모델에 합친 Qwen-Image-2.1을 공개했습니다. 구조와 자체 벤치마크, 한계를 정리합니다.

AI피셜 편집부· 6분 읽기원문 보기 ↗
AI피셜 AI 마스코트가 체커보드 투명 배경 위에 떠 있는 스티커 캐릭터와 알파 채널 아이콘을 들여다봅니다.
배경을 지우는 대신 처음부터 투명하게 만드는 것이 이번 판의 핵심입니다.· 사진: AI 생성 이미지 (ChatGPT 이미지 생성 · Aside 연동)

TL;DR요약

  • Qwen-Image-2.1은 생성과 편집을 한 모델에 합쳤고 시각 생성부는 7B 매개변수, 텍스트·이미지 인코더는 Qwen3-VL 8B입니다.
  • 64채널 RGBA 오토인코더로 투명 이미지를 프롬프트만으로 생성하고, 투명 레이어의 표정과 글자를 편집하며, 사진에서 피사체를 투명 자산으로 뽑아냅니다.
  • 참조 이미지 최대 10장과 원·마스크 표시 부분 편집, 2K 출력, Diffusers·ComfyUI·vLLM-Omni·SGLang 첫날 지원을 갖췄습니다.
  • 자체 벤치마크 Qwen-Image-Bench 60.28점은 회사가 낸 값이며, 라이선스는 Qwen Research License입니다.
AI피셜 마스코트가 생성과 편집의 통합, 알파 채널 투명 이미지, 참조 10장 편집, 회사 벤치마크 60.28점을 네 컷으로 설명합니다.
모델 구조부터 수치의 조건까지 네 컷으로 정리했습니다.· 그림: AI 생성 이미지 (ChatGPT 이미지 생성 · Aside 연동)

핵심 사실

공개
2026-09-20GitHub·Hugging Face·ModelScope에 가중치와 코드가 올라왔습니다.
시각 생성부
7B·32층 DiT단일 스트림 DiT이며 인코더는 별도 Qwen3-VL 8B입니다.
투명 이미지
64채널 RGBA VAE16배 공간 압축, 기본 40단계 추론, 정사각 2048×2048 기본 출력입니다.
자체 벤치마크
60.28점Qwen-Image-Bench 회사 발표 값이며 Nano Banana 2.0 59.82, GPT Image 1.5 59.65와 비교했습니다.

생성과 편집을 한 모델로

알리바바의 Qwen 팀은 2026년 9월 20일 Qwen-Image-2.1을 공개했습니다. 텍스트로 이미지를 만드는 기능과 기존 이미지를 편집하는 기능을 한 파이프라인에 합친 모델이며, 가중치와 코드는 GitHub, Hugging Face, ModelScope에 함께 올라왔습니다. 해커뉴스에서는 하루 만에 570점이 넘는 반응을 얻었습니다. 공식

크기는 작습니다. 시각 생성부는 32층 단일 스트림 DiT(Diffusion Transformer, 확산 모델을 트랜스포머로 구성한 구조)로 70억 매개변수이고, 텍스트와 조건 이미지는 별도의 Qwen3-VL 8B가 읽습니다. 참조 이미지와 편집 지시를 캐시에 두고 매 단계 다시 처리하지 않는 Prefix KV Cache 설계로 여러 장을 참조하는 편집의 비용을 줄였다고 팀은 설명합니다. 공식

배경을 지우지 않고 처음부터 투명하게

가장 눈에 띄는 기능은 투명 이미지 생성입니다. 지금까지 투명 배경 이미지는 보통 일반 이미지를 만든 뒤 배경 제거 도구를 한 번 더 돌려 얻었습니다. Qwen-Image-2.1은 64채널 RGBA 오토인코더를 써서 알파 채널(alpha channel, 픽셀마다 투명도를 담는 정보)을 생성 결과 자체에 포함합니다. 2025년 12월 별도 모델이었던 Qwen-Image-Layered의 기능을 한 모델로 통합한 것입니다. 공식

Hugging Face의 Qwen-Image-2.1 모델 카드 화면입니다. 텍스트로 투명 이미지를 생성하고 편집한다는 소개가 표시되어 있습니다.
Hugging Face 모델 카드입니다. 일반 이미지와 투명 이미지를 한 모델이 처리한다는 점이 첫 줄에 적혀 있습니다.· 사진: Hugging Face 화면 · 분석 목적 인용

공개 예시는 세 갈래입니다. 프롬프트만으로 투명 배경의 캐릭터나 여러 요소가 겹친 구성물을 만들고, 이미 투명한 자산의 표정이나 글자를 배경을 유지한 채 바꾸며, 일반 사진에서 피사체만 투명 자산으로 뽑아냅니다. 저장소는 투명 이미지를 원할 때 “This is an RGBA image with transparency”로 시작하는 프롬프트 형식을 권장합니다. 공식

참조 10장, 원 표시 편집, 2K

편집 쪽도 넓어졌습니다. 참조 이미지를 최대 10장까지 받아 인물, 옷, 신발, 가방 같은 여러 요소를 한 장으로 합칠 수 있고, 원을 그리거나 칠한 표시, 별도 마스크로 고칠 영역을 지정하는 부분 편집을 지원합니다. 출력은 2K이며 기본 추론 단계는 40입니다. Diffusers, ComfyUI, vLLM-Omni, SGLang, LightX2V가 공개 당일 지원을 밝혔습니다. 공식

항목Qwen-Image-2.0Qwen-Image-2.1
생성+편집 통합지원지원
투명(RGBA) 생성미지원지원
참조 이미지제한적최대 10장
원·마스크 부분 편집제한적지원
첫날 ComfyUI미지원지원

수치는 회사가 낸 값입니다

팀은 자체 평가 Qwen-Image-Bench에서 60.28점을 보고했고, 같은 표에 Nano Banana 2.0을 59.82점, GPT Image 1.5를 59.65점으로 실었습니다. 평가 문항과 채점 기준을 회사가 만들었으므로 독립 평가와 구분해 읽어야 합니다. 라이선스는 Qwen Research License로 안내됐고, 상업 이용 조건은 원문 확인이 필요합니다. 공식

7B라는 숫자도 조건이 붙습니다. 이는 시각 생성부만의 크기이고 인코더 Qwen3-VL 8B가 별도로 돕니다. 그럼에도 커뮤니티가 주목한 지점은 크기가 아니라, 생성·편집·투명 출력·다중 참조라는 네 가지 작업을 하나의 작은 파이프라인으로 묶었다는 사실입니다. 보도

자주 묻는 질문

투명 배경 생성이 왜 중요합니까?
기존에는 이미지를 만든 뒤 배경 제거 도구를 따로 돌려 투명 PNG를 얻었습니다. 이 모델은 알파 채널을 생성 자체에 포함해 스티커, 제품 컷아웃, 아이콘, 합성용 요소를 한 번에 만듭니다.
7B면 어느 정도 장비에서 돌아갑니까?
발표문은 낮은 추론 비용을 앞세우고 ComfyUI용으로 BF16·INT8·W4A8 인코더 변형을 제공합니다. 다만 7B는 시각 생성부만의 크기이고 인코더 8B가 따로 붙습니다.
상업적으로 써도 됩니까?
라이선스는 Qwen Research License로 안내됐습니다. 상업 이용 조건은 라이선스 원문을 직접 확인해야 합니다.
벤치마크 점수는 믿을 만합니까?
Qwen-Image-Bench는 회사가 만든 평가이고 비교 대상 점수도 회사가 실었습니다. 독립 평가 전까지는 회사 발표 수치로 읽어야 합니다.

출처 · 4

  1. 1Qwen-Image-2.1 발표문공식 발표qwen.ai/blog?id=qwen-image-2.1
  2. 2Qwen-Image-2.1 GitHub공식 발표github.com/QwenLM/Qwen-Image-2.1
  3. 3Hugging Face 모델 카드공식 발표huggingface.co/Qwen/Qwen-Image-2.1
  4. 4해커뉴스 토론참고news.ycombinator.com/item?id=49775499

이 글의 마크다운 원문: /posts/qwen-image-2-1-native-transparency/md/ · 인용 시 출처를 “AI피셜”으로 표기해 주세요.

편집장의 새 책《의료 바이오 연구자를 위한 AI 신약개발 실전 가이드》 책 표지

의료 바이오 연구자를 위한
AI 신약개발 실전 가이드

Python 기초부터 QSAR·ChemBERTa·GNN,
분자 도킹까지 548쪽 실습서입니다.

책 소개 보기

도움이 됐다면

공유

더보기

다음으로 읽을 글

같은 태그·카테고리에서 세 편을 골랐습니다.

데이터센터 전산실에 줄지어 선 서버 랙과 배선반
오픈소스· 5

Iris — 오픈 웨이트 검색 에이전트, BrowseComp 88.6%

AllSpark Research가 Qwen 기반으로 후속 학습한 오픈 웨이트 검색 에이전트 Iris-mini·Iris-pro를 공개했습니다. 벤치마크 점수와 그 조건(문맥 관리)을 함께 정리했습니다.

  • #오픈소스
  • #검색 에이전트
  • #Qwen
데이터센터 서버실에서 기술자가 노트북을 켜 놓고 서버 랙의 케이블을 정리하고 있다
모델· 8

AI 값 또 내려갈까? 딥시크가 줄인 ‘임시 기억’

딥시크 V4.1-Flash는 토큰당 KV 캐시를 이전 Flash의 약 4분의 1로 줄였습니다. 출력 100만 토큰은 오프피크 0.6달러. 이런 효율화가 다른 회사의 가격까지 바꿨을까요?

  • #DeepSeek
  • #오픈소스
  • #추론 비용
샌프란시스코 파이오니어 빌딩의 벽돌 외관을 올려다본 사진
모델· 7

ChatGPT Images 2.5 — 지연 최대 50% 감소, 값 동결

OpenAI가 9월 8일 새 이미지 모델을 내놨습니다. 생성 지연이 2.0 대비 최대 50% 줄었고, 스케치와 댓글 편집이 붙었으며 API에는 플레어와 선버스트가 추가됐습니다.

  • #OpenAI
  • #모델 출시
  • #이미지 생성