Nano Banana 2 Lite sudah hadir di VibeArt: Gemini 3.1 Flash Lite Image hanya 3 credits per generasi 1K, jadi 100 credits uji coba mencakup sekitar 33 generasi gambar cepat. Coba Nano Banana 2 Lite
Panduan prompt Qwen Image 3: 13 tes nyata untuk teks, infografik, dan UI
Kami menguji Qwen-Image-3.0 dengan 13 prompt nyata: teks kecil, grid 3×3 multibahasa, surat kabar panjang, UI bersarang, edit gambar, dan batas akurasinya.
26 Juli 2026
•Oleh VibeArt Team•
26 min dibaca
•— tayangan
Hal paling menarik dari Qwen-Image-3.0 bukan kemampuannya membuat satu lagi gambar yang cantik. Model ini mencoba memasukkan struktur sebuah hasil siap pakai ke dalam satu gambar: teks kecil, rumus, grafik, hierarki antarmuka, pembagian area, dan pengetahuan.
Janji itu jauh lebih sulit dinilai daripada kualitas visual. Poster dapat terlihat rapi sambil salah mengeja nama. Layar aplikasi dapat memuat semua komponen yang diminta tetapi menyusunnya dalam hierarki informasi yang keliru. Infografik keuangan dapat menampilkan angka dengan jelas—dan tetap menampilkan angka yang salah.
Karena itu, panduan ini mengajukan pertanyaan yang lebih ketat daripada “apakah demonya bagus?”:
Apakah Qwen Image 3 menghasilkan dokumen visual yang benar-benar berguna, atau sekadar tangkapan layar indah yang masih harus diperiksa baris demi baris?
Qwen-Image-3.0 dirilis pada 21 Juli 2026 untuk pembuatan gambar padat informasi: hingga 4,5K token input, teks sekitar 10 piksel, rendering native dalam 12 bahasa, tata letak dokumen kompleks, detail realistis, dan simulasi antarmuka.
Kami menyimpan tiga belas hasil percobaan pertama dari Qwen Chat resmi. Sepuluh tes dasar mencakup infografik 3×3, lima ekspresi matematika, enam sistem tulisan, data keuangan yang kami sediakan, dan halaman depan surat kabar. Tiga stress test berikutnya menaikkan tingkat kesulitan: knowledge wall multibahasa sepanjang 3.646 karakter, surat kabar enam kolom sepanjang 3.812 karakter, dan antarmuka software empat lapis sepanjang 3.538 karakter.
Hasilnya tidak menjadikan Qwen Image 3 perangkat lunak tata letak yang deterministik. Tes UI menambahkan tiga karakter mirip garis miring dan teks palsu; adegan lebar menghasilkan lima drone, bukan empat, serta tiga jembatan, bukan dua. Tes edit mengubah cangkir yang benar dan mempertahankan tulisan, tetapi menurunkan ukuran dari 1792×2400 menjadi 1072×1440 serta mengubah beberapa piksel di luar area target.
Aturan praktisnya sederhana:
gunakan Qwen Image 3 ketika struktur visual, kepadatan informasi, dan komposisi teks-gambar lebih penting daripada kepastian piksel
berikan teks dan data sumber yang persis; jangan meminta model mengarang fakta
periksa setiap karakter, angka, rumus, area, dan hubungan UI sebelum dipublikasikan
simpan fakta, data sumber, dan file yang dapat diedit di luar bitmap hasil generasi
Kesalahan kecil mungkin masih bisa diterima untuk moodboard atau arahan visual. Untuk ujian, materi ilmiah, tabel harga, grafik keuangan, UI produk, atau informasi publik, hasil generasi tetap harus dianggap sebagai draf sampai lolos checklist QA yang jelas.
Apa Itu Qwen-Image-3.0 — Dan Apa Yang Belum Dipublikasikan
Peluncuran resmi menggambarkan model tersebut dengan satu kata: “Nyata.” Qwen membaginya menjadi tiga area:
Konten Kaya — instruksi panjang dan tata letak padat seperti surat kabar, papan cerita, kertas ujian, presentasi, dan antarmuka bertingkat.
Detail Otentik — teks kecil ditambah tekstur visual halus seperti pori-pori, rambut, kulit, dan material fisik.
Pengetahuan Mendalam — rendering multibahasa, perangkat lunak yang familiar dan antarmuka konsumen, serta komposisi yang kaya pengetahuan.
Peluncuran ini menunjukkan infografis 3×3 lengkap yang dihasilkan dalam satu kali lintasan, bukan dirangkai dari sembilan gambar terpisah. Itu adalah arah produk yang bermakna. Hal ini juga menimbulkan beban pembuktian: sembilan wilayah bersih tidaklah cukup jika satu formula, tanggal, label, atau diagram salah.
Mulai 25 Juli 2026, kami dapat memverifikasi dan menggunakan Qwen-Image-3.0 di akun Qwen Chat resmi yang sudah masuk. Percakapan gambar baru ditetapkan secara default ke Qwen-Image 2.0, jadi kami secara eksplisit memilih Qwen-Image 3.0 sebelum setiap pengujian dan mengonfirmasi label model yang terlihat setelah pengiriman.
Alibaba Cloud kini mendokumentasikan ID model API qwen-image-3.0-pro, namun masih dalam pratinjau khusus undangan, bukan ketersediaan umum. Batas Tiongkok-daratan yang terdokumentasi adalah satu permintaan per menit, dan halaman harga mencantumkan pratinjau gratis dengan waktu terbatas, bukan harga ketersediaan umum yang tahan lama. Kami masih tidak dapat memverifikasi bobot 3.0 yang dapat diunduh, kartu model 3.0 publik, laporan teknis, lisensi, jumlah parameter, atau resolusi keluaran maksimum tetap. Repositori Qwen-Image publik belum menambahkan entri rilis 3.0.
Perbedaan itu penting:
Aspek
Status yang kami verifikasi pada 25 Juli 2026
Peluncuran resmi
Dikonfirmasi
Akses Qwen Chat
Dikonfirmasi dengan akun yang sudah login
ID model API 3.0
qwen-image-3.0-pro
Ketersediaan API
Pratinjau khusus undangan
Harga dan batas API
Pratinjau gratis terbatas; 1 permintaan per menit di Tiongkok daratan
Bobot 3.0 yang dapat diunduh
Tidak dikonfirmasi
Kartu model / laporan teknis 3.0
Tidak dikonfirmasi
Lisensi open-source 3.0
Tidak dikonfirmasi
Resolusi keluaran maksimum
Tidak dikonfirmasi
Jangan menyimpulkan bahwa 3.0 adalah open source karena rilis Qwen-Image sebelumnya bersifat terbuka. Jangan menyimpulkan kontrak API produksi dari produk obrolan konsumen.
Apa yang berubah dari Qwen-Image-2.0
Qwen-Image-2.0 telah diposisikan di sekitar infografis profesional, pembuatan dan pengeditan terpadu, keluaran 2K asli, instruksi token sekitar 1K, dan arsitektur yang lebih ringan. Kisah 3.0 beralih dari “pembuatan gambar yang lebih baik dengan teks” menjadi “menghasilkan keseluruhan visual seperti dokumen dalam satu kali jalan.”
Aspek
Qwen-Image-2.0
Qwen-Image-3.0
Panjang instruksi
Sekitar 1K token
Hingga sekitar 4,5K token
Hasil yang umum
Infografis atau satu gambar
Koran, ujian, storyboard, presentasi, UI bersarang, atau infografis padat
Klaim kemampuan teks
Rendering teks yang kuat
Teks kecil hingga sekitar 10 px
Klaim kemampuan pengetahuan
Kualitas generasi dan pengeditan
Komposisi kaya pengetahuan dan antarmuka yang familier
Ketersediaan publik
Contoh API tersedia secara umum
qwen-image-3.0-pro dalam pratinjau khusus undangan
Peningkatan yang berguna bukan sekadar “lebih banyak token”. Yang penting adalah upaya mempertahankan hierarki saat banyak batasan independen muncul sekaligus. Karena itu, kami menilai struktur dan ketepatan secara terpisah.
Cara Kami Menguji: Dokumen Visual Memerlukan Lebih dari Sekadar Skor Kecantikan
Setiap catatan tes:
titik masuk dan label model yang terlihat
tanggal pembuatan
dimensi yang diminta dan sebenarnya
waktu generasi
total percobaan dan percobaan pertama yang dapat digunakan
kesalahan teks persis
kesalahan faktual atau perhitungan
kesalahan tata letak dan wilayah
kesalahan semantik UI
penyimpangan non-target untuk diedit
perkiraan waktu perbaikan manual
Kami tidak menetapkan satu skor keseluruhan. Satu angka menyembunyikan kegagalan yang penting. Sebaliknya, setiap keluaran ditinjau dalam tujuh dimensi:
Dimensi
Apa yang kami periksa
Teks yang tepat
Kasus, tanda baca, angka, simbol, jeda baris, dan ejaan
Akurasi faktual
Tanggal, perhitungan, pernyataan ilmiah, satuan, dan data yang disediakan
Layout
Jumlah wilayah, urutan, posisi relatif, modul yang hilang dan terduplikasi
UI
Hierarki, hubungan komponen, target sentuh, dan logika produk yang familiar
Fidelitas edit
Apakah ada perubahan di luar area edit yang diminta
Kualitas visual
Bahan, pencahayaan, anatomi, komposisi, dan artefak lokal
Efisiensi alur kerja
Waktu tunggu, percobaan ulang, laju penggunaan pertama, dan waktu perbaikan manual
Semua keluaran di bawah dihasilkan pada 25 Juli 2026 di produk web Qwen Chat resmi yang sudah masuk. Setiap hasil yang dipertahankan adalah upaya pertama setelah secara eksplisit memilih dan mengonfirmasi label Qwen-Image 3.0 yang terlihat. Waktu antrian merupakan perkiraan karena UI konsumen tidak memperlihatkan waktu yang dapat dibaca mesin. Qwen tidak mengekspos saklar ekspansi prompt di antarmuka ini, jadi kami tidak dapat mengklaim bahwa penulisan ulang prompt internal telah dinonaktifkan.
Pengujian 1–10 menggunakan keluaran unduhan yang dikonversi ke WebP kualitas-90 tanpa mengubah ukurannya. Pengujian 11–13 menggunakan salinan WebP yang dioptimalkan tanpa mengubah ukuran. Semua gambar disajikan dari CDN kami dalam dimensi piksel aslinya. Prompt lengkap yang digunakan untuk setiap tes muncul di bawah hasilnya; tiga perintah terpanjang diciutkan secara default agar artikel tetap dapat dibaca.
Tes 1: Infografis 3×3 Padat Dan Salinan Tepat
Tes ini memisahkan kesuksesan tata letak dari kesuksesan konten. Ini berisi sembilan wilayah, 27 poin-poin yang diperlukan, rumus, kode status, dan label persisnya.
Hasil: 2048×2048, sekitar 173 detik, satu kali percobaan. Kesembilan wilayah muncul dalam urutan yang diminta. Judul, pernyataan ilmiah, kode status, dan persamaan warna dapat dibaca dan benar. Dua penyimpangan tingkat karakter mencegah skor sempurna literal: ekspresi bunga majemuk diketik sebagai superskrip nyata alih-alih mempertahankan karakter sumber ^(nt), dan diagram pencarian biner berisi label R tambahan. Perkiraan perbaikan manual: 1–2 menit dalam tata letak yang dapat diedit, namun bitmap itu sendiri tidak dapat diperbaiki dengan mudah.
Perintah:
Create a square 1:1 educational infographic with a 3×3 grid on off-white. Each cell has a navy title bar, one simple diagram, and only the specified copy. Do not add, remove, paraphrase, translate, or repeat text.1 WATER CYCLE: Evaporation—liquid becomes vapor; Condensation—vapor forms clouds; Precipitation—water returns to Earth.2 PHOTOSYNTHESIS: Inputs—water, carbon dioxide, sunlight; Output—glucose and oxygen; Location—chloroplasts.3 NEWTON'S LAWS: First—motion stays unchanged without net force; Second—F = ma; Third—every action has an equal opposite reaction.4 BINARY SEARCH: Requires a sorted list; Compare with the middle value; Time complexity—O(log n).5 COMPOUND INTEREST: Formula—A = P(1 + r/n)^(nt); P is the principal; A is the final amount.6 DNA: Bases—A, T, C, G; Shape—double helix; A pairs with T; C pairs with G.7 SUPPLY AND DEMAND: Higher price can reduce demand; Higher price can increase supply; Equilibrium is where curves meet.8 HTTP STATUS: 200 OK; 404 Not Found; 500 Internal Server Error.9 COLOR MIXING: Red + blue = magenta; Blue + green = cyan; Red + green = yellow.Use consistent editorial styling. All text legible. No logo, watermark, or footer.
Tes 2: Teks Kecil, Rumus, dan Halaman Akademik
Rumus yang hanya menyerupai sumbernya saja adalah sebuah kegagalan. Kami memeriksa bilangan prima, limit, batas integral, superskrip, tanda minus, dan setiap digit.
Hasil: 1792×2400, sekitar 89 detik, satu kali percobaan. Kelima pernyataan matematika tersebut benar, meliputi limit, turunan, eksponen, batas integral, tanda prima, logaritma, dan pecahan. Judul, tanggal, dan footer sudah benar. Karakter garis bawah yang diminta setelah Name: menjadi aturan horizontal konvensional, sehingga matematika lolos sementara pelestarian karakter yang ketat tidak. Perkiraan perbaikan manual: kurang dari 1 menit jika sumbernya tetap dapat diedit.
Perintah:
Create a portrait A4 mathematics practice sheet, photographed flat from directly above, black text on white paper.Exact title: "Limits and Derivatives — Practice Sheet"Exact subtitle: "Name: ____________ Date: 2026-07-25"Include exactly these five numbered items:1. lim(x→0) sin(x)/x = 12. d/dx [x³ + 2x² − 5x + 7] = 3x² + 4x − 53. f(x) = e^(2x), therefore f′(x) = 2e^(2x)4. ∫₀¹ 3x² dx = 15. If y = ln(x² + 1), then dy/dx = 2x/(x² + 1)Footer exactly: "Check every exponent, limit, fraction, and derivative symbol before submitting."No handwriting, extra formulas, logo, or watermark.
Tes 3: Rendering Teks Multibahasa
Tes ini menggunakan enam sistem penulisan dan memberikan keunggulan yang sama pada bahasa Arab. Kami memverifikasi ejaan yang tepat, pencampuran karakter, arah, tanda baca, dan apakah model secara diam-diam menambahkan salinan dekoratif.
Hasil: 1696×2528, sekitar 112 detik, satu kali percobaan. Bahasa Inggris, Cina Sederhana, Jepang, Korea, Spanyol, dan Arab semuanya cocok dengan string yang disediakan. Bahasa Arab diterjemahkan dari kanan ke kiri, dan tidak ada baris ketujuh atau teks semu dekoratif yang muncul. Ukuran visual tidak sepenuhnya sama—garis bahasa Inggris lebih lebar—tetapi hierarki tidak menurunkan suatu bahasa. Perkiraan perbaikan manual: tidak ada.
Perintah:
Create a portrait international bookstore poster with a dark green background, cream paper texture, and one central open book. It must contain exactly these six lines and no other text:Stories Across Borders跨越边界的故事国境を越える物語국경을 넘는 이야기Historias sin fronterasحكايات بلا حدودOne language per line, exact spelling, Arabic right-to-left, equal visual importance. No logo, watermark, or invented characters.
Tes 4: UI Realistis versus Logika UI yang Benar
Sebuah antarmuka dapat terlihat masuk akal namun berperilaku tidak seperti produk nyata. Di sini, batasan kritisnya adalah setiap penulis komentar harus muncul di atas teks komentar.
Hasil: 1536×2752, sekitar 157 detik, satu kali percobaan. Hirarki postingan, tiga penulis, urutan komentar, jumlah tindakan, dan navigasi bawah semuanya benar. Setiap penulis muncul di atas komentar yang cocok. Masih gagal dalam kebersihan penyalinan: mesin terbang seperti garis miring terbalik muncul sebelum setiap komentar, dan pratinjau gambar berisi tulisan pseudo-CJK yang dibuat-buat. Ini adalah mockup UI yang meyakinkan, bukan tangkapan layar produksi. Perkiraan perbaikan manual: 3–5 menit dalam file desain.
Perintah:
Create a portrait 390×844 dark-mode mobile social app screenshot.Top: avatar, centered "Following", search and settings.Post hierarchy: "Maya Chen", "@mayac", "2h", text "Testing a multilingual poster workflow today.", one landscape preview, then reply 12, repost 28, like 316, bookmark.Exactly three comments, username ABOVE comment text:Leo Park — "The spacing feels much better now."Sofia Ruiz — "Can you test Spanish text next?"Amir Haddad — "Please include Arabic direction too."Bottom navigation: Home, Search, Create, Notifications, Profile; Home active. Believable spacing and touch targets. No extra comments, numbers, device frame, logo, or watermark.
Tes 5: Jumlah Objek Tepat dan Batasan Spasial
Perintah tata letak objek mudah diaudit. “Hampir delapan objek” bukanlah hasil subjektif.
Hasil: 2048×2048, sekitar 88 detik, satu kali percobaan. Tepatnya delapan kategori objek muncul, setiap item terlihat sepenuhnya, dan kedelapan kategori tersebut menempati wilayah yang ditetapkan. Tidak ada kategori duplikat atau tambahan dekoratif. Paspornya sengaja polos karena promptnya juga melarang teks. Perkiraan perbaikan manual: tidak ada.
Perintah:
Create a square top-down product photograph on a matte charcoal table. Show exactly eight objects and nothing else:1 red passport at top-left2 silver fountain pen at top-center3 black compact camera at top-right4 green ceramic cup at middle-left5 closed blue notebook at exact center6 white earbuds case at middle-right7 yellow keychain at bottom-left8 pair of round brown sunglasses at bottom-rightEvery object fully visible, separated, only in its assigned position. Soft studio shadows, realistic materials. No text, logo, watermark, or duplicates.
Tes 6: Infografis Keuangan Dengan Fakta yang Disediakan
Model menerima setiap nomor. Kami menghitung ulang total dan persentasenya sendiri, lalu memeriksa apakah polesan visual mengubah data.
Hasil: 2752×1536, sekitar 138 detik, satu kali percobaan. Setiap nilai dan label yang diberikan benar: 12.4, 15.1, 14.5, 42.0, 45.0, 3.0, dan 93.3%. Batang mengikuti urutan April–Mei–Juni, Mei adalah yang tertinggi, jumlah totalnya benar, dan tidak ada metrik tambahan yang ditemukan. Perkiraan perbaikan manual: tidak ada.
Perintah:
Create a landscape financial infographic using only this data.Title: "Northwind Q2 Revenue"Subtitle: "All values in USD millions"April 12.4; May 15.1; June 14.5; Quarter total 42.0; Quarter target 45.0; Gap to target 3.0.Include one April-May-June bar chart, progress "42.0 of 45.0", callout "May was the strongest month", and callout "Target attainment: 93.3%". Every number, label, bar order, and calculation must match exactly. No other metrics, conversion, logo, or watermark.
Tes 7: Fotorealisme, Usia, Tangan, Dan Detail Material
Ini bukanlah potret kecantikan. Adegan sumber juga menjadi masukan untuk uji pelestarian berikutnya.
Hasil: 1792×2400, sekitar 78 detik, satu kali percobaan. Hasilnya memiliki detail usia yang dapat dipercaya, cahaya jendela dari kiri, tangan alami dengan masing-masing lima jari, sisa tanah liat, tekstur bahan, cangkir putih di sebelah kanan, dan teks kartu persis FIRE TO 1220°C. Komposisi menjadi berorientasi potret meskipun rasio aspek tidak ditentukan; itu adalah pilihan produk dan bukan pelanggaran langsung. Perkiraan perbaikan manual: tidak ada.
Perintah:
Documentary-style environmental portrait of a 58-year-old female ceramic artist seated at a wooden worktable in her studio. Natural window light from the left. Visible age lines, realistic pores, a few gray hairs, clay dust on both hands, small wrinkles in a linen apron, unfinished stoneware bowls on wooden shelves, subtle fingerprints on wet clay.Place one plain white ceramic cup on the right side of the table. Place a small paper studio card behind it containing exactly the text "FIRE TO 1220°C".Neutral color grading, 50mm lens look, shallow but believable depth of field. Preserve natural asymmetry and real skin texture. No glamour retouching, no waxy skin, no extra fingers, no other text, no logo, no watermark.
Tes 8: Pengeditan Gambar Dan Pelestarian Non-Target
Hasil Tes 7 digunakan sebagai satu-satunya masukan. Pengeditan yang diminta sengaja dibuat berukuran kecil; setiap perubahan lainnya dihitung sebagai penyimpangan.
Asli: 1792×2400Diedit: 1072×1440
Hasil: sekitar 61 detik, satu kali percobaan. Cangkir menjadi biru kobalt dengan satu bulan sabit emas, sementara orang, tangan, celemek, arah cahaya, rak, meja, tanah liat, dan kartu tembak yang tepat tetap dekat secara visual. Ini bukan pengeditan piksel-lokal: layanan ini mengurangi kedua dimensi sekitar 40%, dan setelah mengubah ukuran sumber ke dimensi yang diedit, rata-rata perbedaan saluran RGB absolut di luar cup mask konservatif adalah 9,4 pada skala 0–255. Pengeditan ini berguna secara visual, namun resolusi dan pelestarian non-target harus diperiksa sebelum melakukan pengeditan lebih lanjut. Perkiraan perbaikan manual: tidak ada untuk permintaan ini; peningkatan skala ulang atau pengomposisian sumber mungkin diperlukan dalam produksi.
Perintah:
Edit only the ceramic cup on the right side of the table: change its color from white to deep cobalt blue and add a small gold crescent on its front.Preserve every other detail as closely as possible, including the person's identity, face, hands, clothing, lighting, camera angle, table objects, background shelves, and the exact existing text "FIRE TO 1220°C". Do not move, resize, add, or remove anything else.
Tes 9: Tata Letak Koran Dan Salinan Panjang
Pengujian ini memeriksa kolom, hierarki, teks persisnya, penanganan tanggal, dan apakah model membuat judul tambahan untuk membuat halaman terlihat lebih lengkap.
Hasil: 1792×2400, sekitar 141 detik, satu kali percobaan. Kepala surat, tanggal, judul utama, dek, tiga baris daftar periksa, salinan cuaca, dan catatan kaki semuanya cocok. Outputnya tidak menambahkan teks artikel buatan dan mempertahankan hierarki halaman depan yang kredibel di sekitar foto yang diminta. Perkiraan perbaikan manual: tidak ada.
Perintah:
Create a portrait broadsheet newspaper front page photographed flat overhead. Use exactly this readable copy and no other text.Masthead: "THE DAILY WORKBENCH"Date: "Saturday, July 25, 2026"Main headline: "Small Teams Turn Visual Drafts Into Deliverables"Deck: "A new workflow keeps prompts, source data, revisions, and approvals connected."Left headline: "Three Checks Before Publishing"Bullets: "Verify every number"; "Compare every label"; "Preserve the editable source"Right headline: "Weather"Copy: "Morning cloud, afternoon sun, high 24°C."Footer: "Edition 01 • Price $2.00"Black, warm white, muted red; one photo of a designer reviewing a proof; believable hierarchy and columns. No invented copy, logo, or watermark.
Tes 10: Pemandangan Ekstrim Luas dan Detail Lokal
Pemandangan lebar memperlihatkan tekstur yang berulang, anatomi yang lemah, dan kesenjangan antara resolusi nominal dan detail yang berguna.
Hasil: 2752×1536, sekitar 96 detik, satu kali percobaan. Adegan ini memiliki tiga wilayah yang jelas berbeda, tepatnya tiga perahu surya, sebuah pesawat udara, menara yang bervariasi, lebih dari 20 orang, dan aktivitas jalan kaki, bersepeda, olahraga, melukis, piknik, dan catur yang dapat dikenali. Kepatuhan dalam penghitungan gagal: yang terlihat adalah lima drone pengantar barang, bukan empat, dan tiga struktur jembatan, bukan dua. Anatomi manusia yang kecil dapat diterima pada ukuran halaman tetapi lembut pada zoom asli. Perkiraan perbaikan manual: 5–10 menit dengan penghapusan atau regenerasi objek.
Perintah:
Create an ultra-wide 16:9 realistic future ecological city.Left third: residential towers with varied vertical gardens and maintenance walkways, no repeated facade.Center: river with exactly three solar passenger boats and two pedestrian bridges.Right: public park with at least 20 visible people doing distinct activities including walking, reading, cycling, chess, and exercise.Sky: exactly four delivery drones and one transparent passenger airship.Coherent daylight, scale, anatomy, natural materials, continuous city plan. No text, logo, watermark, cloned people or trees, repeated windows, malformed limbs, or impossible bridges.
Tes stres ekstrem: prompt panjang, teks padat, dan UI bersarang
Peluncuran resmi tidak hanya menampilkan sampel yang menarik. Contoh tersulitnya menggabungkan prompt panjang dengan keluasan horizontal—dinding pengetahuan 3×3 yang utuh—atau kedalaman vertikal, ketika satu antarmuka memuat antarmuka lain yang masih berisi konten terstruktur. Kami merancang tiga tes baru pada dua sumbu tersebut.
Brief ini sengaja dibuat nyaris tidak masuk akal bagi generator gambar biasa. Tujuannya bukan membuktikan bahwa bitmap dapat menggantikan alat layout koran, alur lokalisasi, atau editor kode. Tujuannya adalah menemukan batas antara lengkap secara struktur dan tepat kata demi kata.
Tes
Panjang prompt
Hasil struktur
Kegagalan teks
11. Dinding pengetahuan 3×3 ekstrem
3.646 karakter
Kesembilan tema masuk ke grid yang ketat
Sebagian teks non-Latin berukuran paling kecil rusak
12. Koran lebar enam kolom
3.812 karakter
Semua modul utama koran muncul
Artikel utama dan sebagian teks Mandarin tidak sama persis dengan sumber
13. UI bersarang empat lapis
3.538 karakter
Keempat lapisan antarmuka dan enam langkah runbook muncul
Kode tampak meyakinkan, tetapi mengandung kesalahan sintaks dan ejaan
Ini adalah versi Tes 1 yang jauh lebih sulit. Sembilan sel harus mencakup perintah insiden, geometri spasial, genomik, jaringan tanpa kepercayaan, respons topan, kontrol perbankan, pencarian jalan dalam 12 bahasa, SOP laboratorium, dan pemeriksaan kesiapan kapal. Perintah tersebut menggabungkan rumus, tabel, panah, koordinat, label status, dan 12 skrip sambil melarang modul yang dihilangkan atau diciptakan.
Hasil: 2048×2048, sekitar 130 detik, satu percobaan Qwen-Image 3.0 dipertahankan. Model ini menghasilkan grid 3×3 yang ketat dengan sembilan domain yang diminta dan sistem visual yang koheren. Judul bahasa Inggris dan Mandarin, rumus, koordinat, sebagian besar angka, dan entri tabel yang lebih besar tetap dapat terbaca. Hasilnya terbaca sebagai satu artefak yang dirancang dan bukan sembilan gambar mini yang tidak terkait.
Kegagalan ini muncul ketika klaim resmi dalam teks kecil dan multibahasa menjadi paling sulit untuk digabungkan. Beberapa string Rusia, Arab, dan Hindi berukuran mikro salah format; salinan legenda topan kecil dan beberapa label panah jaringan runtuh menjadi teks semu. Beberapa tanda baca desimal dilokalisasi dari titik hingga koma. Ini melewati kelengkapan struktural tetapi gagal dalam QA multibahasa literal.
Lihat perintah 3.646 karakter persis yang digunakan untuk Tes 11
请用 Qwen-Image 3.0 一次性生成一张超高信息密度、正方形 1:1、清晰可读的专业“3×3 应用知识图谱”海报。它不是九张图拼接,而是一张统一设计系统中的完整九宫格;严格 3 行×3 列,共 9 格,不多不少。画布四周留 64px 外边距,格间留 28px 白色沟槽,每格都有细灰边框、独立标题栏、编号 01–09、图表区、正文区和页脚来源标签。全图使用瑞士国际主义信息设计:白底、深墨蓝文字、青色/橙色/红色作为状态色,网格严谨,印刷级排版。主标题精确写:“QWEN IMAGE 3 — EXTREME 3×3 KNOWLEDGE WALL”;副标题精确写:“Nine domains · one canvas · zero omitted labels”。所有引号中的文字必须逐字呈现,不得改写、翻译、漏字或生成乱码;正文允许 10–14px 视觉字号但仍需清晰。严禁水印、品牌误拼、额外面板、跨格元素、重复图标。第 01 格,标题精确写:“INCIDENT COMMAND / 事故指挥”。左侧画一条 5 节点时间轴,逐行精确写:“09:17 API latency > 2.0s”“09:21 Error rate reaches 8.4%”“09:26 Read replica isolated”“09:34 Cache warmed to 92%”“09:41 Service fully recovered”。右侧是四张 KPI 小卡:“P95 684 ms”“Errors 0.7%”“RPS 12,480”“MTTR 24 min”。底部红框写:“DECISION: HOLD DEPLOYMENT”。第 02 格,标题精确写:“SPATIAL GEOMETRY / 空间几何”。绘制透明立方体 ABCD–A₁B₁C₁D₁、对角线 AC₁、平面 BB₁D₁D 和 35° 角标。右侧严格排出三行公式:“|AC₁| = √(a²+b²+c²)”“cos θ = (u·v)/(|u||v|)”“V = |a·(b×c)|”。下方定理框逐字写:“If u·n = 0, then u ∥ plane Π.” 和中文:“向量与法向量垂直,则向量平行于平面。”第 03 格,标题精确写:“GENOMICS PIPELINE / 基因组流程”。从左到右画五步流程:“Sample → Extraction → Library → Sequencing → Variant Call”。画双螺旋、FASTQ 文件、覆盖度直方图、染色体 7 的局部放大。小表格三列标题:“Variant”“Depth”“Effect”,三行精确数据:“chr7:140453136 A>T | 812× | missense”“chr12:25398284 C>G | 406× | intronic”“chr17:7674220 G>A | 1,024× | stop gained”。页脚写:“Reference: GRCh38 · QC PASS”。第 04 格,标题精确写:“ZERO-TRUST NETWORK / 零信任网络”。画清晰架构图:左侧“USER DEVICE”经过“IDENTITY PROXY”进入中心“POLICY ENGINE”,再分流到“WEB APP”“POSTGRES”“OBJECT STORE”;每条箭头旁分别标注“mTLS”“OIDC”“short-lived token”“deny by default”。右下角放 2×2 状态卡:“Auth 99.99%”“Blocked 1,284”“Risk HIGH 03”“Key age 17d”。底部精确写:“Never trust. Always verify. Log every decision.”第 05 格,标题精确写:“TYPHOON BRIEFING / 台风简报”。画东亚沿海地图、台风路径 6 个时间点、同心风圈、颜色图例。路径标签精确写:“T+00 18.2°N 126.4°E”“T+12 19.7°N 124.8°E”“T+24 21.3°N 123.1°E”“T+36 23.8°N 121.6°E”“T+48 26.1°N 120.9°E”“T+60 28.4°N 121.7°E”。右侧风险表:“Wind 145 km/h — SEVERE”“Rain 280 mm — EXTREME”“Surge 2.4 m — HIGH”。警示条写:“EVACUATE LOW-LYING AREAS BEFORE 18:00”。第 06 格,标题精确写:“BANK CONTROL MATRIX / 银行内控矩阵”。画 4×4 表格,列标题:“Control”“Owner”“Frequency”“Evidence”;四行精确写:“Dual approval | Treasury | Daily | Signed ledger”“Limit review | Risk | Weekly | Exception log”“Access recertification | Security | Quarterly | IAM report”“Backup restore | SRE | Monthly | Recovery record”。右侧画环形图:“PASS 87%”“OPEN 9%”“OVERDUE 4%”。底部橙框精确写:“3 HIGH-RISK EXCEPTIONS REQUIRE ACTION”。第 07 格,标题精确写:“12-LANGUAGE WAYFINDING / 十二语导视”。画现代地铁换乘站平面图,中央圆形“PLATFORM 4”,八条彩色线路,四个出口。右侧必须逐行准确出现以下 12 行,不合并:“English — Central Station”“中文 — 中央车站”“日本語 — 中央駅”“한국어 — 중앙역”“Español — Estación Central”“Français — Gare Centrale”“Deutsch — Hauptbahnhof”“Italiano — Stazione Centrale”“Português — Estação Central”“Русский — Центральный вокзал”“العربية — المحطة المركزية”“हिन्दी — केंद्रीय स्टेशन”。底部写:“Exit C · Lift · Tickets · First Aid”。第 08 格,标题精确写:“LAB SOP / 实验室规程”。画分子结构、烧杯、移液器、离心机和四枚标准危险图标。右侧编号步骤逐字写:“1. Wear nitrile gloves and goggles.”“2. Add 25.0 mL buffer at 4°C.”“3. Centrifuge 12,000×g for 10 min.”“4. Transfer exactly 200 μL supernatant.”“5. Record batch ID before disposal.” 参数卡写:“pH 7.40 ± 0.05”“Temp 4°C”“RPM 13,200”“Timer 00:10:00”。红色页脚:“DO NOT MIX ACID WITH HYPOCHLORITE”。第 09 格,标题精确写:“SHIP-READINESS CHECK / 发布检查”。画 12 项双列核对清单,每项前有绿色勾或橙色圆点,文字精确为:“Schema migration reviewed”“Rollback tested”“Feature flag off by default”“Secrets rotated”“Error budget checked”“Accessibility AA”“Mobile 360px verified”“P95 under 800 ms”“Audit log retained”“Runbook linked”“On-call acknowledged”“Customer notice drafted”。右下角盖章精确写:“GO WITH CONDITIONS”。页脚版本号:“REV 3.0 · 2026-07-25 · OWNER: PLATFORM”。整张图必须在一张画布中维持九格互不干扰:每格视觉语言统一但内容图形各异;所有表格行列对齐;数字、标点、上下标、希腊字母、中文、阿拉伯文、天城文都清楚;无随机伪文字,无文本块缺失。优先保证文字准确性、九格完整性和可判读性,其次才是装饰。
Tes 12: Koran Enam Kolom Dengan Salinan Bentuk Panjang
Surat kabar dasar menggunakan sekumpulan kecil judul yang sama persis dan salinan pendeknya. Versi ini meminta lembar enam kolom asli dengan kepala surat, tanggal dan garis harga, berita utama berjudul LUNAR WATER TREATY CLEARS FINAL VOTE, tiga paragraf bahasa Inggris yang disediakan, foto dan keterangan bulan, kartu KPI, bagan garis, tabel pasar lima baris, empat kiriman, bagian berbahasa Mandarin, rumus penelitian dan tabel data, kotak pengarahan, dan footer literal.
Hasil: 1792×2400, sekitar 75 detik, satu kali percobaan. Hirarkinya sangat bagus. Setiap modul utama ada, judul utama dan judul utama benar, KPI dan tabel pasar dapat dibaca, dan bagan, kiriman, bagian bahasa Mandarin, persamaan, diagram stratigrafi, tabel penelitian, pengarahan, alamat email, dan nomor halaman semuanya menempati posisi surat kabar yang dapat dipercaya.
Ini bukan salinan yang sempurna. Paragraf pembuka bahasa Inggris berisi kata-kata yang tumpang tindih dan rusak, beberapa body copy dan byline berbahasa Mandarin berbeda dari sumber yang diberikan, dan beberapa kalimat panjang diparafrasekan atau dipersingkat. Gambar tersebut merupakan komposisi editorial yang luar biasa meyakinkan, tetapi menerbitkannya tanpa menyusun salinannya lagi akan menjadi tidak aman.
Lihat perintah 3.812 karakter persis yang digunakan untuk Tes 12
请使用 Qwen-Image 3.0 生成一张竖版 4:5、2048px 级别、可直接印刷的真实英文数据报纸首页。它不是海报,而是一张完整 broadsheet newspaper front page:纸张有轻微米白纤维、墨色细微渗透、折痕和套印误差,但所有文字必须清晰。采用严格 6 栏网格、细黑分隔线、经典衬线正文字体、无衬线数据标签。主报头逐字写:“THE ORBITAL LEDGER”;其下细字逐字写:“Independent reporting for Earth, Moon and Mars”;左上日期:“FRIDAY, JULY 25, 2026”;右上:“VOL. 18 · NO. 207 · PRICE $3.50”。不得生成伪文字,不得用无意义 lorem ipsum,不得遗漏引号中的任何段落。所有正文保持真实报纸密度,最小字看起来约 10px 但放大可读。第一、二、三栏组成头版主稿。超大标题精确写:“LUNAR WATER TREATY CLEARS FINAL VOTE”。副标题精确写:“Twelve nations agree on shared extraction limits, emergency reserves and open telemetry after a 19-hour session.” 署名精确写:“BY MAYA CHEN · SCIENCE & POLICY EDITOR”。正文必须逐字排出以下三段,不改写:“GENEVA — Delegates approved the Lunar Water Accord at 04:12 local time on Friday, creating the first enforceable limits on polar ice extraction. The agreement assigns annual quotas, protects permanently shadowed craters, and requires every operator to publish machine-readable telemetry within sixty seconds.”“Negotiators resolved the final dispute by placing a six-month emergency reserve under joint control. Any release now requires three independent signatures: one from the host nation, one from the scientific council, and one from the civilian settlement network.”“Markets reacted cautiously. Oxygen futures fell 2.8 percent while launch-insurance shares rose. Engineers welcomed the data clause but warned that sensor calibration standards must be finished before the treaty takes effect on January 1, 2027.”主稿中间放一张写实月球南极基地照片:低角度阳光、机械臂、冰样品罐、三名宇航员;照片说明逐字写:“Survey team 7A returns from Shackleton Ridge with sealed core samples. PHOTO: LUNA PRESS POOL”。第四栏顶部做数据模块,标题:“THE NUMBERS”。四行 KPI 精确写:“12 signatory nations”“18.6 million liters annual cap”“15% emergency reserve”“60 seconds telemetry delay”。其下画折线图标题:“WATER OUTPUT, 2027–2032”,横轴年份 2027、2028、2029、2030、2031、2032,纵轴标注“million liters”,三条线图例严格写:“Approved quota”“Projected demand”“Protected reserve”。图下注释:“Forecast range: ±6.2%”。第五栏顶部标题:“MARKET SIGNALS”。画 5 行金融表格,列标题严格为:“Asset”“Close”“Change”。数据逐行精确写:“OXY-FUT 84.20 −2.8%”“HELIO 118.44 +1.6%”“CISLUNAR 72.09 +0.4%”“ICE-INDEX 204.81 −1.1%”“LAUNCH-RE 51.77 +3.2%”。表下短文逐字写:“Volume was 31 percent above the 20-day average. Analysts cited lower scarcity risk and stronger compliance spending.”第六栏顶部标题:“FIELD DISPATCHES”。列出四条带地点的小稿,每条标题和句子都要准确:“SHACKLETON — Power restored” 下写:“A damaged 40 kV cable was isolated at 06:30; habitats remained on battery for eleven minutes.”“MARE IMBRIUM — Dust alert” 下写:“Electrostatic dust reached level orange. Exterior maintenance is paused until 14:00 UTC.”“TYCHO — School opens” 下写:“The first bilingual primary school welcomed 86 students from nine settlement zones.”“L1 GATEWAY — Docking delay” 下写:“Cargo vehicle Kestrel-4 will berth six hours late after a guidance-software rollback.”页面下半部横跨前三栏做中文栏目。栏目名准确写:“中文速览”。标题:“月球水资源公约通过最终表决”。正文两段逐字写:“十二个参与国同意公开开采遥测数据,并为科研、民用与应急储备设定独立配额。公约将永久阴影区列为重点保护区域,任何商业作业都必须保留完整审计记录。”“联合执行委员会每季度发布一次透明度报告。若连续两次未能上报数据,相关运营方将自动暂停许可证,直至第三方完成安全复核。”右下角署名:“记者 陈雨 · 日内瓦”。页面下半部中间做科研插页,标题:“RESEARCH NOTE: ICE STABILITY”。准确排出公式:“∂C/∂t = D∇²C − kC” 和 “T_eq = 112 ± 4 K”。画三层剖面:“REGOLITH 0–18 cm”“MIXED ICE 18–64 cm”“DENSE ICE >64 cm”。旁边小表格列标题:“Depth”“Purity”“Confidence”,三行:“22 cm | 31% | 0.82”“48 cm | 67% | 0.94”“81 cm | 91% | 0.97”。注释逐字写:“n = 214 cores · instrument drift corrected”。页面最下方横贯六栏的短讯带标题:“BRIEFING”。依次排出四条:“Solar weather: G2 storm watch begins 16:00 UTC.” “Earth desk: Pacific heatwave breaks 14 records.” “Mars desk: Valles Marineris relay returns to service.” “Culture: The zero-gravity orchestra announces an autumn tour.” 最底部页脚精确写:“orbitalledger.news · Corrections: corrections@orbitalledger.news · Printed with 62% recycled fiber”。右下角印页码:“A1”。整体要求:像真实获奖报纸设计,不像 AI 海报;六栏从头到尾对齐;长段落完整;英文大小写、连字符、百分号、邮箱、数学符号、中文标点准确;照片与图表服务于内容但不遮挡文字;绝无随机字母串、重复段落、水印或多余标题。优先保证所有指定文本逐字可读。
Pengujian 13: Antarmuka Perangkat Lunak Bersarang Empat Lapis
Pengujian ini meminta satu gambar untuk mempertahankan hierarki semantik di empat lapisan yang terlihat: shell desktop bergaya VS Code; browser tertanam yang menampilkan dasbor insiden Atlas Ops; hamparan obrolan telepon; dan kartu runbook yang ada di dalam UI ponsel tersebut. Ringkasan ini juga menyediakan kode sumber, log terminal, KPI, peta jaringan, grafik, tabel insiden, pesan obrolan, dan enam langkah runbook yang diurutkan.
Hasil: 2752×1536, sekitar 125 detik, satu kali percobaan. Keempat lapisan tersebut ada dan batasannya dapat segera dipahami. Dasbor menyimpan peta, grafik, hierarki KPI, garis waktu, dan tabel insiden. Ponsel berisi percakapan yang diminta, dan runbook paling dalam mempertahankan keenam langkah ditambah bidang pemilik, rollback, pemeriksaan, dan aturan. Ini adalah demonstrasi yang kuat dari komposisi UI dan penyusunan semantik.
Editor kode adalah titik lemahnya. Nama fungsi dan jalur menyimpang, function salah eja, kurung kurawal dan struktur garis tidak konsisten, dan beberapa baris terduplikasi. Nilai desimal juga mengubah tanda baca. Hasilnya sangat bagus sebagai gambar konsep produk dan berbahaya sebagai tangkapan layar kode literal: sintaksis yang masuk akal bukanlah sintaksis yang valid.
Lihat perintah 3.538 karakter persis yang digunakan untuk Tes 13
请用 Qwen-Image 3.0 一次生成一张 16:9、2560×1440 视觉分辨率、极清晰的“四层嵌套软件界面”真实产品截图。核心测试是纵向语义深度:外层是 VS Code;VS Code 的右侧预览里嵌套一个浏览器运维仪表盘;仪表盘中弹出一个手机协作聊天窗口;聊天里又嵌入一张微型事故处置卡片。四层必须同时完整、边界清晰、透视一致,不能把某层的按钮或文字串到另一层。所有引号里的文本必须逐字呈现,代码标点、日志时间、表格数字、手机消息和最内层卡片都要可读。不要水印,不要随机伪文字,不要重复窗口。第 1 层:完整 VS Code 深色界面,占整张图。顶部 macOS 标题栏和交通灯按钮,窗口标题精确写:“atlas-ops — Visual Studio Code”。菜单精确写:“File Edit Selection View Go Run Terminal Help”。左侧 Activity Bar 有 Explorer、Search、Source Control、Run、Extensions 五个标准图标。Explorer 标题:“ATLAS-OPS”,文件树准确显示:“src”“app”“api”“incidents”“route.ts”“components”“IncidentPanel.tsx”“lib”“telemetry.ts”“package.json”“README.md”。打开的标签页有:“route.ts”“IncidentPanel.tsx”“telemetry.ts”。底部状态栏逐项写:“main*”“0 errors”“2 warnings”“Ln 18, Col 27”“Spaces: 2”“UTF-8”“TypeScript”“Prettier”。VS Code 中央编辑区打开 src/app/api/incidents/route.ts,显示带语法高亮、行号 1–18 的 TypeScript 代码,代码必须尽量准确排出:“import { NextResponse } from 'next/server'”“import { getIncidentSummary } from '@/lib/telemetry'”“”“export async function GET() {”“ const summary = await getIncidentSummary({”“ service: 'payments',”“ windowMinutes: 30,”“ includeRegions: ['us-east', 'eu-west', 'ap-south'],”“ })”“”“ return NextResponse.json({”“ generatedAt: '2026-07-25T09:42:18Z',”“ status: summary.errorRate > 0.02 ? 'degraded' : 'healthy',”“ summary,”“ })”“}”当前行高亮在第 13 行。左下 Terminal 面板标题精确写:“TERMINAL OUTPUT DEBUG CONSOLE PORTS”。终端命令与输出逐行写:“$ npm run dev”“▲ Next.js 16.2.6”“✓ Ready in 842ms”“GET /api/incidents 200 in 47ms”“WARN payments error_rate=0.034 region=eu-west”“INFO fallback_route=active recovered=92%”。第 2 层:VS Code 右侧约 44% 宽区域是内嵌浏览器预览,但仍在 VS Code 编辑器分栏内。浏览器地址栏精确写:“https://ops.atlas.example/incidents/INC-2048”。页面是浅色专业运维仪表盘,页眉左侧标志:“ATLAS OPS”,面包屑:“Incidents / INC-2048”,右侧绿色状态:“LIVE · updated 09:42:18 UTC”。主标题:“Payment authorization latency”。红色标签:“SEV-1 ACTIVE”。副标题:“Elevated p95 and issuer timeouts in EU West”。四张指标卡逐字写:“P95 LATENCY 2.84 s”“ERROR RATE 3.4%”“AFFECTED 18,240”“RECOVERED 92%”。仪表盘左中画欧洲地图,三枚节点标签:“DUBLIN 4.1%”“FRANKFURT 3.7%”“PARIS 2.9%”,红色链路从 Dublin 指向 Frankfurt。右中折线图标题:“Latency by region · last 30 min”,图例:“eu-west”“us-east”“ap-south”,横轴从 09:12 到 09:42,红线在 09:31 峰值 3.2s。下方时间线表格列标题:“Time”“Event”“Owner”“State”,四行精确写:“09:17 | Alert fired | SRE Bot | OPEN”“09:23 | Traffic shifted 20% | Mina K. | DONE”“09:31 | Issuer timeout spike | Payments | WATCH”“09:39 | Cache warm 92% | Leo R. | DONE”。右下按钮:“OPEN RUNBOOK”“ACKNOWLEDGE”“START BRIDGE”。第 3 层:仪表盘右下角覆盖一个约页面高度 48% 的手机协作窗口,外形像真实现代手机但完全在浏览器预览内部,不可溢出到 VS Code。手机顶部频道名:“# incident-inc-2048”,旁边小字:“8 members · bridge live”。消息按时间排列,头像与气泡清晰:“09:24 Mina — Shifted 20% of EU traffic. Error rate is falling.”“09:28 Leo — Cache warm-up reached 74%. ETA six minutes.”“09:33 SRE Bot — Threshold breached: issuer_timeout > 3.0%.”“09:37 Priya — No data loss. Retries remain idempotent.”“09:41 Mina — Recovery at 92%. Holding deployment until 10:15.”输入框占位文字:“Message #incident-inc-2048”,右侧按钮:“Send”。顶部红点提示:“1 unresolved decision”。第 4 层:在手机里 Priya 的消息下方嵌一张小而完整的事故处置卡片,像聊天附件,卡片标题精确写:“RUNBOOK R-17 · PAYMENT DEGRADATION”。橙色状态条:“CURRENT STEP 4 OF 6”。六步纵向流程必须出现并带编号:“1 Confirm telemetry”“2 Freeze deploys”“3 Shift 20% traffic”“4 Warm issuer cache”“5 Validate retries”“6 Restore gradually”。第 1–3 步绿色打勾,第 4 步橙色高亮,第 5–6 步灰色。卡片底部三项细字:“Owner: Payments SRE”“Rollback: ready”“Next check: 09:46 UTC”。最下方红色规则:“STOP IF ERROR RATE > 5%”。整体要求:外层 VS Code 像真正桌面应用,内层浏览器像真正 SaaS,第三层手机像真实协作工具,第四层卡片像真实附件;四层尺度递减但每层关键文字仍清晰;每一层只显示属于自己的导航和控件;代码、终端、指标、地图、折线图、时间线、手机消息、六步 runbook 全部存在。优先级依次是:层级完整 > 文本准确 > UI 真实性 > 装饰。
Bersama-sama, ketiga keluaran ini memperlihatkan batas atas model saat ini. Qwen-Image-3.0 sangat baik dalam menjaga banyak modul dan hubungannya dalam satu kali proses. Ketepatan menurun lebih cepat daripada struktur karena teks menjadi lebih kecil, jumlah skrip bertambah, atau salinan menjadi seperti kode. Pembedaan tersebut harus menentukan apakah keluaran dapat dikirimkan atau harus tetap berupa rancangan visual.
Di mana Qwen Image 3 masih gagal
Kategori kegagalan lebih penting daripada papan peringkat:
Teks yang jelas masih bisa berupa teks yang salah. Keterbacaan bukanlah ketepatan.
Tata letak yang benar dapat berisi pengetahuan yang salah. Diagram dan label memerlukan pemeriksaan terpisah.
Antarmuka yang realistis dapat melanggar logika antarmuka. Tinjau hierarki dan hubungan, bukan hanya piksel.
Kepadatan sekali jalan meningkatkan biaya audit. Lebih banyak konten per gambar berarti lebih banyak peluang terjadinya kesalahan diam-diam.
Bitmap bukanlah dokumen yang dapat diedit. Pertahankan teks sumber, data, dan maksud tata letak di luar keluaran yang dihasilkan.
Edit yang berhasil tetap dapat mengubah area lain. Bandingkan identitas, teks, pencahayaan, dan komposisi dengan gambar input.
Akurasi multibahasa menurun ketika ukuran huruf mengecil. Model dapat lolos pada poster enam baris bahasa, tetapi gagal merender sistem tulisan yang sama sebagai teks mikro di dalam grid padat.
Kode yang masuk akal bukanlah kode yang dapat dieksekusi. Perlakukan tangkapan layar editor yang dihasilkan sebagai konsep visual kecuali setiap token diverifikasi secara independen.
Perbandingan awal pihak ketiga yang diterbitkan setelah peluncuran melaporkan perbedaan penting yang sama: Qwen dapat menghasilkan tata letak yang meyakinkan dan adegan realistis namun tetap membuat kesalahan teks Arab, kesalahan pengetahuan dalam poster sains, dan kesalahan hierarki informasi di UI sosial. Kami memperlakukan pengamatan tersebut sebagai hipotesis uji, bukan sebagai hasil kami sendiri.
Formula Prompt Qwen Image 3 yang Dapat Digunakan Kembali
Prompt panjang bekerja lebih baik jika ditulis seperti brief produksi:
[deliverable type][canvas / aspect ratio / visual hierarchy][exact source copy or source data][region-by-region composition][style, material, and lighting][non-negotiable constraints][explicit forbidden additions][verification instruction]
Lima aturan praktis:
berikan teks sumber persisnya; jangan meminta model untuk menulis teks faktual untuk Anda
memberi nomor wilayah dan hierarki alih-alih menyembunyikan persyaratan tata letak dalam satu paragraf
gunakan exactly, only, dan no other text agar hasilnya dapat diaudit
ubah satu variabel inti per pengujian
simpan prompt, sumber data, keluaran, dan catatan ulasan bersama-sama
infinite Canvas dari VibeArt berguna untuk alur kerja yang lebih luas ini bahkan sebelum Qwen Image 3 diintegrasikan: menjaga materi sumber, upaya model, perbandingan, pengeditan, dan persetujuan tetap terlihat alih-alih kehilangannya di utas obrolan terpisah.
Qwen Image 3 vs GPT Image 2: pilihan praktis
Jawabannya bergantung pada pekerjaannya, bukan skor universal.
Pilih Qwen Image 3 untuk evaluasi ketika Anda perlu menguji brief yang sangat panjang, komposisi padat seperti dokumen, gabungan beberapa sistem tulisan, serta klaim Qwen tentang antarmuka dan pengetahuan. Pilih GPT Image 2 di VibeArt ketika Anda memerlukan model yang sudah tersedia dalam alur kerja Canvas untuk pembuatan, perbandingan, penyempurnaan, dan ekspor.
Jangan bandingkan galeri Qwen resmi pilihan dengan keluaran GPT rata-rata. Gunakan perintah sumber yang sama, nonaktifkan penulisan ulang jika produk mengizinkannya, ulangi pengujian, catat dimensi dan waktu keluaran aktual, dan nilai ketepatan secara terpisah dari kualitas visual.
Dapatkah saya menggunakan Qwen Image 3 secara online?
Ya. Kami menghasilkan ketiga belas keluaran yang disimpan di produk web resmi Qwen Chat dengan akun masuk. Akses produk dapat bervariasi berdasarkan akun dan status peluncuran. Percakapan gambar baru ditetapkan secara default ke Qwen-Image 2.0 di sesi kita, jadi verifikasi dan pilih secara eksplisit label Qwen-Image 3.0 yang terlihat sebelum memperlakukan output sebagai hasil 3.0.
Apakah ada API Qwen Image 3?
Ya, dengan kualifikasi penting. Alibaba Cloud mendokumentasikan ID model qwen-image-3.0-pro, namun model tersebut saat ini merupakan pratinjau khusus undangan, bukan API produksi yang tersedia secara umum. Batas tarif Tiongkok-daratan yang terdokumentasi adalah satu permintaan per menit. Perlakukan akses dan batasan sebagai kondisi pratinjau yang mungkin berubah.
Apakah Qwen Image 3 open source?
Kami tidak dapat memverifikasi bobot 3.0 yang dirilis atau lisensi 3.0. Repositori Qwen-Image yang lebih lama adalah Apache-2.0, tetapi itu tidak secara otomatis berlaku untuk paket bobot 3.0 yang belum dirilis.
Berapa harga Qwen Image 3?
Halaman harga Alibaba Cloud mencantumkan qwen-image-3.0-pro sebagai gratis dengan waktu terbatas di Tiongkok daratan selama pratinjau. Itu bukan harga ketersediaan umum yang stabil dan tidak membuktikan bahwa setiap wilayah, akun, atau tingkatan Qwen Chat gratis. Periksa halaman harga regional saat ini sebelum membuat model biaya.
Apakah Qwen Image 3 menghasilkan 2K atau 4K?
Kami tidak dapat memverifikasi maksimum model tetap. Catat dimensi sebenarnya dari titik masuk produk yang digunakan untuk setiap pengujian; jangan mengubah satu hasil produk menjadi batas model universal.
Kesimpulan: gunakan sebagai generator yang dipasangkan dengan sistem QA
Gagasan terpenting Qwen-Image-3.0 bukan gambar yang lebih cantik, melainkan kemampuan satu gambar hasil generasi untuk mempertahankan struktur sebuah output yang kompleks.
Kemampuan itu hanya berguna jika dipasangkan dengan proses review. Fakta tetap disimpan di luar bitmap; teks dan hierarki visual diperiksa secara terpisah; percobaan gagal ikut dicatat; input edit dipertahankan; dan waktu yang diukur adalah generasi plus perbaikan, bukan generasi saja.
Batas praktisnya jelas: jika pekerjaan layout 40 menit berubah menjadi lima menit generasi dan lima menit review, model ini meningkatkan produktivitas. Jika memeriksa dan memperbaiki gambar padat membutuhkan waktu lebih lama daripada membuat ulang dokumen dalam format editable, hasilnya masih sebuah demo yang mengesankan—bukan output siap pakai.
Itulah batas yang diuji oleh tiga belas percobaan pertama Qwen-Image 3.0 ini.