Context
2K
Input
text
Output
image
Tool calling
Not listed
About this model
Qwen-Image-Txt2Img is a 14B-parameter diffusion model specialized in high-quality text-to-image generation with enhanced prompt understanding and stylistic versatility. Part of the Qwen multimodal family, it features advanced composition control, style adaptation, and detail preservation across diverse visual domains.
Input modalities
text
Accepted as model input
Providers
Available routing options for this model through OneInfer.
Available
Image generation
$0.200 / image
Routing
OneInfer optimized
Pricing
Current OneInfer pricing for this model.
| Usage | Price |
|---|---|
| Image generationstandard · 1024*1024 | $0.200 / image |
Performance
Published evaluation results associated with this model.
Image Quality
FID-30K12.8
CLIP Score33.2
Inception Score192.4
Precision87.6
Recall85.3
Prompt Understanding
Attribute Binding89.4
Spatial Reasoning84.7
Complex Prompt Accuracy86.9
Style Adaptation91.2
Domain Specialization
Photorealistic90.8
Artistic Styles92.4
Concept Art88.9
Technical Illustration85.7
Product Visualization87.3
API example
curl -X POST https://api.oneinfer.ai/v1/ula/generate-image \
-H "Authorization: Bearer YOUR_JWT_TOKEN" \
-H "Content-Type: application/json" \
-d '{
"provider": "novita",
"model": "Qwen/Qwen-image-txt2img",
"messages": [
{
"role": "user",
"content": "A futuristic city skyline at dusk"
}
],
"number": 1,
"size": "1024*1024",
"quality": "standard"
}'