یکی از اعصابخردکنترین مشکلات تولید تصویر با هوش مصنوعی این است که تصویر فوقالعاده شده، نور و ترکیببندی دقیقاً همان چیزی است که میخواستیم، اما روی تابلو نوشته شده:
«BEST COFEE SH0P»
یا بدتر؛ چیزی که اصلاً قابل خواندن نیست!
البته این مشکل نسبت به گذشته خیلی کمتر شده. مدلهای جدیدی مثل ChatGPT Images و ابزارهایی مثل Ideogram در تولید متن داخل تصویر پیشرفت زیادی کردهاند؛ با این حال، نوع نوشتن پرامپت هنوز تأثیر زیادی روی نتیجه دارد.
مشکل از کجاست؟
مدل تصویرساز در اصل برای ساخت «تصویر» آموزش دیده، نه اینکه مثل Photoshop با متن رفتار کند. بنابراین اگر فقط بنویسیم:
یک کافه مدرن با تابلوی Coffee Shop
مدل ممکن است بفهمد که یک تابلو باید وجود داشته باشد، اما الزاماً تضمین نمیکند که دقیقاً عبارت Coffee Shop را روی آن بنویسد.
برای همین باید متن را مثل یک المان طراحیشده تعریف کنیم، نه صرفاً بخشی از صحنه.
قانون اول: متن را دقیقاً داخل کوتیشن بنویس
یکی از سادهترین ترفندها این است که متن موردنظر را داخل " " قرار بدهیم.
مثلاً به جای:
A poster with AI is the future
بنویس:
A modern technology poster with the exact headline "AI IS THE FUTURE"
در راهنمای رسمی OpenAI هم توصیه شده برای متنهای داخل تصویر، متن را داخل کوتیشن یا با حروف بزرگ مشخص کنیم و جایگاه، رنگ، اندازه و سبک فونت را هم تعیین کنیم.
پرامپت بهتر:
Create a premium technology poster. Put the exact headline "AI IS THE FUTURE" at the top, bold modern sans-serif font, white text, centered, large size. No other text.
این قسمت آخر یعنی:
No other text
خیلی مهم است؛ چون جلوی تولید نوشتههای تصادفی اضافه را تا حدی میگیرد.
قانون دوم: متن را کوتاه نگه دار
هرچقدر متن داخل تصویر طولانیتر شود، احتمال خطا هم بیشتر میشود.
مثلاً:
Welcome to the future of artificial intelligence and discover how technology is changing the way we work
برای تصویر، خیلی طولانی است.
اما:
"THE FUTURE OF AI"
خیلی قابلکنترلتر است.
اگر واقعاً به پاراگراف یا متن طولانی احتیاج داری، بهتر است تصویر را بدون متن بسازی و تایپوگرافی را بعداً در Photoshop، Figma یا Illustrator اضافه کنی. حتی OpenAI هم برای طراحیهای دارای متن زیاد توصیه میکند بعد از تولید، متن را در ابزار طراحی نهایی polish کنید.
قانون سوم: فقط متن را نگو؛ جای آن را هم مشخص کن
مثلاً:
Add the text Memory Hack.
چون مدل میفهمد:
*چه چیزی بنویسد
*کجا بنویسد
*چقدر بزرگ باشد
*چه رنگی باشد
*چه استایلی داشته باشد
مثلاً برای یک پوستر:
Create a cinematic AI poster.
Headline:
"MEMORY HACK"
Place the headline at the top center.
Large bold sans-serif typography.
White text.
High contrast.
Clean spacing.
No other text.
این ساختار برای عنوانهای کوتاه واقعاً کاربردی است.
قانون چهارم: متن را از تصویر اصلی جدا تعریف کن
این یکی از ترفندهای مهمتر است.
به جای اینکه همه چیز را در یک جمله قاطی کنیم، پرامپت را ذهنی به چند بخش تقسیم کنیم:
Subject → Environment → Text → Typography → Placement
مثلاً:
A cinematic futuristic AI laboratory.
Main subject: a researcher standing in front of glowing screens.
Text:
"AI MEMORY"
Typography:
bold geometric sans-serif,
clean white lettering.
Placement:
large headline at the top center.
No additional text.
این روش باعث میشود مدل راحتتر بفهمد کدام قسمت از درخواست مربوط به تصویر است و کدام قسمت مربوط به تایپوگرافی.
یک ترفند خفن: متن را یک «آبجکت» در نظر بگیر
به جای اینکه بگویی:
یک فروشگاه قهوه با نوشته Coffee
بگو:
A realistic coffee shop with a large illuminated storefront sign displaying the exact text "COFFEE LAB".
یعنی متن را تبدیل کن به یک شیء مشخص:
storefront sign
یا:
neon sign
یا:
billboard
یا:
book cover
یا:
product label
یا:
poster headline
این کار Context بیشتری به مدل میدهد.
برای لوگو چه کار کنیم؟
اینجا قضیه کمی متفاوت است.
اگر مثلاً میخواهی لوگویی با نام:
Looms
بسازی، بهتر است دقیقاً بگویی:
A premium coffee brand logo featuring the exact word "Looms", clean geometric typography, minimal design, centered wordmark, no additional letters or symbols.
ولی اگر دقت ۱۰۰٪ لازم داری، پیشنهاد بهتر این است که AI فرم کلی لوگو را بسازد و نوشته نهایی را خودت در Figma یا Illustrator قرار بدهی.
چون حتی مدلهای بسیار خوب هم ممکن است در یک خروجی خاص یک حرف را اشتباه کنند.
کدام AI برای متن داخل تصویر بهتر است؟
اگر تمرکز اصلی پروژه روی پوستر، تبلیغات، بستهبندی، تابلو، لوگو و تایپوگرافی است، ابزارهایی که روی Text Rendering تمرکز دارند انتخاب منطقیتری هستند.
Ideogram
Ideogram بهصورت مشخص روی تولید متن داخل تصویر تمرکز کرده و خودش اعلام میکند که Text Rendering یکی از قابلیتهای اصلی آن است. حتی قابلیت Layerize Text دارد که متن تولیدشده را به لایه قابل ویرایش تبدیل میکند.
ChatGPT Images
برای ساخت تصویر همراه با متن و مخصوصاً ویرایش چندمرحلهای گزینه بسیار خوبی است. میتوانی بعد از ساخت تصویر بگویی:
متن روی تابلو را به "AI MEMORY" تغییر بده، بقیه تصویر را دست نزن.
ChatGPT Images امکان اضافهکردن و ویرایش متن داخل تصویر را دارد.
Midjourney
Midjourney هم در نسخههای جدید امکان تولید متن داخل تصویر را دارد. طبق مستندات رسمی، متن موردنظر را باید داخل double quotation marks قرار داد؛ متنهای کوتاه و لاتین معمولاً نتیجه بهتری میدهند و برای خطاهای متنی میتوان از Raw یا Stylize پایینتر و ابزار Editor/Vary Region استفاده کرد.
یک فرمول آماده برای پرامپت
اگر بخواهم یک فرمول ساده بدهم که برای اکثر پروژهها جواب بدهد:
[نوع تصویر]
Main subject:
[موضوع اصلی]
Exact text:
"[متن دقیق]"
Typography:
[فونت / وزن / استایل]
Placement:
[محل قرارگیری]
Color:
[رنگ]
Composition:
[ترکیببندی]
No other text.
No misspelled words.
مثلاً:
A cinematic 3D technology poster.
Main subject:
A futuristic AI laboratory with glowing holographic interfaces.
Exact text:
"THE FUTURE OF AI"
Typography:
bold modern sans-serif,
clean geometric lettering.
Placement:
large centered headline at the top.
Color:
white text with subtle cyan glow.
Composition:
premium cinematic advertising poster.
No other text.
No misspelled words.
البته عبارتهایی مثل No misspelled words تضمین جادویی نیستند؛ اصل ماجرا این است که متن کوتاه، دقیق، مشخص و دارای جایگاه مشخص باشد.
و مهمتر از همه: اگر متن حیاتی است، AI را مجبور نکن همهچیز را انجام دهد
برای یک Thumbnail ساده، تولید مستقیم متن داخل تصویر کاملاً منطقی است.
اما برای چیزهایی مثل:
بنر تبلیغاتی، پوستر، بستهبندی محصول، UI، اینفوگرافیک، منوی رستوران، قیمت، اطلاعات تماس یا لوگو
بهترین Workflow معمولاً این است:
AI → ساخت تصویر و Composition
↓
Figma / Photoshop → تایپوگرافی نهایی
اینطوری AI مسئول خلاقیت تصویری است و نرمافزار طراحی مسئول چیزی که باید پیکسلبهپیکسل درست نوشته شود.
و همین تفاوت کوچک، خروجی را از یک «عکس AI» به یک طراحی قابل استفاده واقعی تبدیل میکند.



