Unlock exclusive introductory pricing for the newly launched Gemini 3.5 Flash.

Kan Qwen-Image Model omdefinere AI-billedgenerering og -redigering?

CometAPI
annaAug 5, 2025
Kan Qwen-Image Model omdefinere AI-billedgenerering og -redigering?

Den 4. august 2025 blev Alibabas Qwen-team officielt lanceret Qwen-billede, en multimodal diffusionstransformer (MMDiT)-fundamentsmodel med 20 milliarder parametre, der er designet til at levere hidtil uset nรธjagtighed i tekst-til-billede-syntese og prรฆcis billedredigering. Denne udgivelse markerer Alibabas dristige indtrรฆden i open source-billedgenereringsarenaen og positionerer Qwen-Image som en direkte udfordrer til proprietรฆre systemer som OpenAI's GPT-4o, DALLยทE 2 og Midjourney.

Tekniske innovationer

Qwen-Image's 20 B MMDiT Rygraden markerer en betydelig ingeniรธrmรฆssig bedrift, der gรธr det muligt for modellen at udmรฆrke sig ved at gengive komplekst tekstindhold direkte i genererede billeder. Dens tilgang til lรฆseplaner begynder med simple ikke-tekstlige gengivelsesopgaver og udvikler sig gradvist til at hรฅndtere beskrivelser af afsnitslรฆngde, hvilket giver enestรฅende nรธjagtighed i bรฅde alfabetiske og logografiske sprog. Desuden inkorporerer modellen en dobbeltkodning mekanisme โ€“ separat behandling af semantiske og rekonstruktive reprรฆsentationer via Qwen2.5-VL og en VAE-encoder โ€“ som skaber en balance mellem at opretholde semantisk konsistens og visuel realisme under billedredigeringer.

Gennembrud inden for tekstgengivelse og redigering

En vigtig differentiator for Qwen-Image er dens indbygget understรธttelse af indlejret tekst, hvilket gรธr det muligt at placere lรฆsbar engelsk og kinesisk tekst i billeder pรฅ tvรฆrs af layouts med flere linjer og afsnitskontekster. Interne benchmarks viser, at Qwen-Image overgรฅr mange open source-rivaler i hurtig overholdelse og tekstklarhed, hvilket gรธr det ideelt til applikationer, der krรฆver flersprogede designelementer. Dets billedredigeringsfunktioner drager ogsรฅ fordel af et multitask-trรฆningsparadigme, der integrerer tekst-til-billede, tekst-billede-til-billede og billede-til-billede-rekonstruktionsopgaver, hvilket forbedrer konsistensen ved รฆndring af eksisterende visuelle elementer.

Uafhรฆngige evalueringer demonstrerer Qwen-Images overlegenhed i forhold til adskillige fรธrende open source- og proprietรฆre modeller, hvad angรฅr nรธjagtighed i tekstindlejring. I sammenlignende tests overgรฅr det mellemklasse-open source-alternativer og konkurrerer med kommercielle tilbud som Midjourney for hurtig overholdelse โ€“ isรฆr pรฅ tosprogede prompts, der kombinerer engelsk og kinesisk. Mens nogle proprietรฆre systemer stadig kan vรฆre fรธrende i generering af ultrakomplekse scener, fremhรฆver tidlig brugerfeedback Qwen-Images uovertrufne klarhed til flersprogede tekstlayouts og dets robuste redigeringskontroller.

I overensstemmelse med Alibabas engagement i "รฅben, transparent og bรฆredygtig" AI er Qwen-Image รฅben kode pรฅ MoDa-platformen og inviterer til bidrag og tilpasninger fra fรฆllesskabet. Sidelรธbende med modeludgivelsen har Alibaba udgivet omfattende dokumentation, eksempelkode og en feedbackportal for at understรธtte test i den virkelige verden pรฅ tvรฆrs af forskellige use cases โ€“ fra automatiserede publiceringspipelines til interaktive uddannelsesvรฆrktรธjer.

Evalueringsresultater

Alibabas interne benchmarks og tredjepartsvurderinger tegner et billede af Qwen-Images fรธrende prรฆstation:

  • GenEval (Generel billedgenerering): Opnรฅede en Frรฉchet Inception Distance (FID) pรฅ 10.2, hvilket i gennemsnit overgรฅr sammenlignelige 20 B-parametermodeller med 9 %.
  • LongText-Bench (Tekstgengivelse): scorede 92.7 % nรธjagtighed i placering af tekst over flere linjer og glyffernes integritet, hvilket overgรฅr GPT-4.1 med 14 %.
  • GEdit/ImgEdit (Billedredigering): Registreret en gennemsnitlig opinionsscore (MOS) pรฅ 4.3/5, hvilket afspejler hรธj brugertilfredshed med at opretholde semantisk konsistens under redigeringer
  • OneIG-Bench (Generering af infografik): Rangeret blandt de tre bedste modeller til visuel gengivelse af strukturerede data og diagrammer direkte fra prompts, hvilket demonstrerer stรฆrke layout- og farvevalgsfunktioner.
  • RanglistePรฅ Artificial Analysis Image Arena Leaderboard indtager Qwen-Image i รธjeblikket 5. pladsen blandt alle billedgenereringsmodeller โ€“ og er den eneste open-weight-model i top 10 โ€“ hvilket demonstrerer sin konkurrencefordel i forskningsmiljรธet.

Adgang og รธkosystem

Qwen-Images alsidige funktioner รฅbner op for en rรฆkke virkelige applikationer:

  • Marketing og annoncering: Hurtig oprettelse af skrรฆddersyede reklamebilleder med integrerede slogans og flersprogede tekstelementer.
  • Pรฆdagogisk indhold: Automatiseret generering af illustrative diagrammer, infografik og kommenterede billeder til e-lรฆringsplatforme.
  • Design og prototyping: Mockups og konceptkunst i realtid med redigerbare lag til interaktive kreative arbejdsgange.
  • Lokaliseringstjenester: Problemfri tilpasning af visuelle elementer til forskellige sproglige kontekster uden manuel grafisk designindsats.

Brugere kan interagere med Qwen-Image via Alibabas Chat Qwen-grรฆnseflade ved at vรฆlge tilstanden "Image Generation" eller integrere modellen i deres miljรธer via GitHub-repository'et og CometAPI API'er.

  • Interaktiv brug: Besรธg chat.qwen.ai og vรฆlg en hvilken som helst ikke-kodende Qwen-model, og skift derefter til "Billedgenerering" for at begynde at oprette.
  • Kode og vรฆgte:
  • GitHub: github.com/QwenLM/Qwen-Image
  • Knusende ansigt: huggingface.co
  • Modelscopemodelscope.cn

Alibaba opfordrer til feedback og bidrag fra lokalsamfundet for at fremme en รฅben, transparent og bรฆredygtig generativt AI-รธkosystem.

Den seneste integration med Qwen-Image vil snart blive vist pรฅ CometAPI, sรฅ fรธlg med! Mens vi fรฆrdiggรธr uploaden af Qwen-Image-modellen, kan du udforske vores andre modeller pรฅ modelsiden eller prรธve dem i AI Playground.

CometAPI er en samlet API-platform, der samler over 500 AI-modeller fra fรธrende udbydere โ€“ sรฅsom OpenAIs GPT-serie, Googles Gemini, Anthropics Claude, Midjourney, Suno og flere โ€“ i en enkelt, udviklervenlig grรฆnseflade. Ved at tilbyde ensartet godkendelse, formatering af anmodninger og svarhรฅndtering forenkler CometAPI dramatisk integrationen af โ€‹โ€‹AI-funktioner i dine applikationer. Uanset om du bygger chatbots, billedgeneratorer, musikkomponister eller datadrevne analysepipelines, giver CometAPI dig mulighed for at iterere hurtigere, kontrollere omkostninger og forblive leverandรธruafhรฆngig โ€“ alt imens du udnytter de seneste gennembrud pรฅ tvรฆrs af AI-รธkosystemet.

Se ogsรฅ

Klar til at skรฆre AI-udviklingsomkostninger med 20%?

Kom gratis i gang pรฅ fรฅ minutter. Gratis prรธvekreditter inkluderet. Intet kreditkort pรฅkrรฆvet.

Lรฆs mere