dall-e-3, den textrenderande gpt-image-1 med starkare förmåga, den senaste generationen gpt-image-2, samt nano-banana / nano-banana-2 / nano-banana-pro serien som nås via samma gränssnitt. Alla kan generera högkvalitativa bilder baserat på textbeskrivningar.
Detta dokument beskriver huvudsakligen användningsprocessen för OpenAI Images Generations API, som gör det enkelt att använda OpenAI-seriens bildgenereringsfunktioner.
Ansökningsprocess
För att använda OpenAI Images Generations API kan du först gå till sidan OpenAI Images Generations API och klicka på knappen “Acquire” för att få de nödvändiga autentiseringsuppgifterna: Om du inte är inloggad eller registrerad kommer du automatiskt att omdirigeras till inloggningssidan där du kan registrera dig och logga in. Efter inloggning återvänder du automatiskt till denna sida. Vid första ansökan får du en gratis kvot som gör att du kan använda API:et kostnadsfritt.GPT-Image-2 Modell
gpt-image-2 är OpenAIs nya generation av bildgenereringsmodell, som jämfört med dall-e-3 och gpt-image-1 har tydliga förbättringar inom följande områden:
- Starkare efterlevnad av instruktioner: Kan exakt förstå komplexa kompositioner, räkning, positionsrelationer och andra strukturerade instruktioner.
- Klarare textrendering: Engelska och siffror i affischer, menyer, infografik och logotyper visas nästan utan fel.
- Rikare stiluttryck: Stödjer ursprungligen flera stilar såsom filmiska porträtt, retroaffischer, barnillustrationer, produktfotografi och infografik.
- Inbyggt stöd för flera proportioner + hög upplösning: Täcker 5 proportioner (1:1, 4:3, 3:4, 16:9, 9:16) med 3 upplösningsnivåer (1K / 2K / 4K).
model till gpt-image-2. I returvärdet är url en permanent bildlänk hostad på platform.cdn.acedata.cloud, som kan öppnas direkt i webbläsare eller bäddas in på webbsidor.
Stödda size värden
gpt-image-2 kontrollerar endast formatet på size. Så länge det inte är auto eller en tom sträng måste det matcha WIDTHxHEIGHT (t.ex. 1024x1024, 2048x1152, 800x600); andra format ger 400-fel. Alla storlekar (1K / 2K / 4K / anpassade) debiteras per bild, ingen extra kostnad för storlek.
Upstream har hårda begränsningar för anpassade storlekar: bredd och höjd måste vara multiplar av 16, längsta sidan ≤ 3840, total pixelantal ≤ 8,294,400. Överskrids detta avvisas förfrågan med 4xx.
Du kan också angesize: "auto"eller utelämnasize-fältet, då väljer modellen standardstorlek själv. Vid 1K-nivå garanteras inte strikt pixeljustering — om du skickar1024x1024kan du få1254x1254, proportionen bibehålls. Om du skickar tillbaka denna somsizeändras inte debiteringen. 4K-anrop tar vanligtvis 4–8 minuter, rekommenderas att användacallback_urlför asynkron återkoppling.
OmNedan visas några verkliga exempel för att intuitivt visan-parameterngpt-image-2stöder för närvarande inten > 1: denna parameter ignoreras tyst, oavsett om du skickarn=1ellern=10returneras bara en bild per anrop och debiteras för en bild. Om du behöver flera bilder samtidigt, gör flera parallella anrop (helst med olikapromptellerseed, annars kan bilderna bli mycket lika). Samma begränsning gäller förgpt-image-1/gpt-image-1.5samtnano-banana/nano-banana-2/nano-banana-pro.dall-e-2är för närvarande den enda modellen som inbyggt stödjern > 1;dall-e-3stödjer endastn = 1.
gpt-image-2 kapacitet.
Scenario 1: Filmiskt porträtt
I prompten kan du använda filmtermer (35mm film, kort skärpedjup, neonljus etc.) för att exakt styra atmosfär och känsla. Python-exempel:Scenario 2: Retro reseaffisch (med textrendering)
gpt-image-2 är stabil i typografi och layout, perfekt för affischer, menyer, gratulationskort med text.
url i returvärdet:
Modellen återger tydligt Art Deco-stilen och texten AMALFI och ITALIA 1958 är korrekt och klart renderad.
Scenario 3: Komplex komposition och räkning
Denna prompt testar modellens förmåga att följa strukturerade instruktioner om antal och position.dall-e-3-eran.
Scenario 4: Illustrationsstil (landskapsformat)
Genom att specificera konstnärligt medium och stämningsord kan modellen generera stiliserade illustrationer.Asynkron och callback
gpt-image-2 tar vanligtvis 60–90 sekunder per anrop. Om du inte vill hålla en lång anslutning kan du använda callback_url-mekanismen för asynkron återkoppling. Anropsflödet är identiskt med andra modeller.
Nano Banana Serien
nano-banana serien är bildgenereringsmodeller baserade på Gemini, tillgängliga via samma /openai/images/generations-endpoint utan att byta endpoint, bara ändra model till någon av nedanstående:
Viktigt: stödda parametrar Nano Banana använder en adapter för OpenAI-protokollet och stöder endast följande parametrar jämfört medgpt-image-*:model,prompt,size.
sizemappas enligt tabell nedan till internaspect_ratio; ej listade storlekar faller tillbaka till1:1:
1024x1024/512x512/256x256→1:11792x1024→16:91024x1792→9:16- Stöder inte
n,quality,style,response_format,background,output_format; dessa ignoreras om angivna.- Returformat följer OpenAI-standard (
data[].url), mencreatedär alltid0,b64_jsonreturneras inte, ochrevised_promptär alltid lika med originalprompt.
Grundläggande anrop
url:
Uppgradera till flaggskeppsmodellen nano-banana-pro
Byt bara model till nano-banana-pro, övriga parametrar är oförändrade:
Asynkron callback
callback_url-mekanismen fungerar även för nano-banana, anropsflödet är identiskt med andra modeller, se avsnittet Asynkron callback nedan.
Grundläggande användning
Du kan fylla i motsvarande fält i gränssnittet, som visas nedan: Vid första användningen behöver du minst fylla i tre fält:authorization väljs direkt från dropdown-menyn, model som är den OpenAI DALL-E modellkategori du vill använda (här finns huvudsakligen en modell, se våra modeller för detaljer), och prompt som är texten för bildgenerering.
Till höger visas motsvarande genererade anropskod som du kan kopiera och köra, eller testa direkt med knappen “Try”.
Python-exempel:
created: ID för bildgenereringsuppdraget, unikt för denna uppgift.data: innehåller bildgenereringsresultatet.
data finns detaljer om genererad bild, där url är bildens detaljlänk, som visas nedan:
Bildkvalitetsparameter quality
Här beskrivs hur du ställer in detaljerade parametrar för bildgenerering, där quality har två värden: standard för standardbild och hd för bild med finare detaljer och högre konsistens.
Exempel på inställning av quality till standard:
Till höger visas motsvarande anropskod som kan kopieras eller testas direkt.
Python-exempel:
quality satt till standard visas nedan:
Samma anrop med quality satt till hd ger bilden nedan:
hd-bilden har finare detaljer och högre konsistens än standard.
Bildstorleksparameter size
Du kan också ange bildens storlek.
Exempel med size satt till 1024x1024:
Till höger visas motsvarande kod som kan kopieras eller testas.
Python-exempel:
1024x1024 visas nedan:
Samma anrop med storlek 1792x1024 ger följande bild:
Storleken är tydligt annorlunda. Fler storlekar finns, se vår officiella dokumentation.
Bildstilsparameter style
style har två värden: vivid för mer livfulla bilder och natural för mer naturliga bilder.
Exempel med style satt till vivid:
Till höger visas anropskod som kan kopieras eller testas.
Python-exempel:
style satt till vivid visas nedan:
Samma anrop med style satt till natural ger följande bild:
vivid ger mer levande och realistiska bilder än natural.
Bildlänkens formatparameter response_format
Den sista parametern response_format har två värden: b64_json som kodar bilden i Base64, och url som är en vanlig bildlänk.
Exempel med response_format satt till url:
Till höger visas anropskod som kan kopieras eller testas.
Python-exempel:
response_format satt till url är direkt åtkomlig, bilden visas nedan:
Samma anrop med response_format satt till b64_json ger Base64-kodad bild enligt nedan:
Asynkron callback
Eftersom bildgenerering kan ta tid och API-förfrågan kan hålla anslutningen öppen och belasta systemresurser, stödjer API:et asynkron callback. Flödet är: klienten skickar medcallback_url i förfrågan, API returnerar omedelbart ett svar med task_id som identifierar uppgiften. När uppgiften är klar skickar API en POST med JSON till callback_url med samma task_id för att koppla ihop resultatet.
Exempel:
Webhook callback är en HTTP-tjänst som kan ta emot förfrågningar. Byt ut URL:en mot din egen server. För demonstration används https://webhook.site/ som genererar en publik webhook-URL:
Kopiera URL:en, t.ex. https://webhook.site/3d32690d-6780-4187-a65c-870061e8c8ab.
Skicka sedan anrop med callback_url satt till denna URL:
task_id och data med samma bildgenereringsresultat som synkront anrop, vilket möjliggör koppling via uppgifts-ID.
Felhantering
Vid fel returnerar API lämplig felkod och meddelande, t.ex.:400 token_mismatched: Felaktig förfrågan, saknade eller ogiltiga parametrar.400 api_not_implemented: Felaktig förfrågan, saknade eller ogiltiga parametrar.401 invalid_token: Obehörig, ogiltig eller saknad token.429 too_many_requests: För många förfrågningar, gränsen överskriden.500 api_error: Intern serverfel.

