Skip to main content
Mix text and image_url inside a message’s content to let the model understand an image (image input, not image generation).
Vision-capable models (e.g. gpt-5, gemini-2.5-flash, claude-sonnet-4-6) accept image input.