مستندات API آلفا
آلفا ارزانترین ارائهدهندهی API هوش مصنوعی در تمام اینترنت است و همهی 13 مدل
از یک مسیر واحد صدا زده میشوند. یک درخواست POST میفرستید،
یک شناسه میگیرید، و تا آماده شدن خروجی وضعیت را میپرسید. تمام پاسخها JSON هستند.
یک: پردازشها ناهمزماناند و همیشه باید وضعیت را پرسید.
دو: هزینه در همان لحظهی ثبت درخواست رزرو میشود و اگر پردازش شکست بخورد کامل برمیگردد.
سه: متن فارسی را مستقیم بفرستید؛ ترجمهی داخلی خودکار انجام میشود.
احراز هویت
هر درخواست باید کلید شما را در هدر Authorization با پیشوند Bearer داشته باشد.
کلیدها از پنل کاربری ساخته و لغو میشوند.
Authorization: Bearer ak_live_xxxxxxxxxxxxxxxxxxxx
اگر کتابخانهی شما هدر سفارشی راحتتر است، X-API-Key هم پذیرفته میشود.
اولین درخواست
این نمونه یک تصویر میسازد و تا آماده شدن منتظر میماند.
import os, time, requests
BASE = "https://api.appalpha.ir/v1"
H = {"Authorization": f"Bearer {os.environ['ALPHA_KEY']}"}
job = requests.post(f"{BASE}/generations", headers=H, json={
"model": "flux-dev",
"prompt": "یک باغ ایرانی در بهار، نور طلایی عصر",
"width": 1024,
"height": 1024,
}).json()
print(job["id"], job["cost_toman"])
while True:
time.sleep(3)
out = requests.get(f"{BASE}/generations/{job['id']}", headers=H).json()
if out["status"] != "processing":
break
if out["status"] == "ready":
print(out["output"]["url"])
else:
print("خطا:", out["error"]["message"])
ساخت درخواست
فیلد model همیشه لازم است. بقیهی فیلدها به مدل انتخابی بستگی دارند و
در فهرست مدلها برای هر کدام جداگانه آمده است.
| فیلد | نوع | توضیح |
|---|---|---|
model | string | شناسهی مدل، مثلاً flux-dev. الزامی. |
prompt | string | توضیح خروجی. فارسی یا انگلیسی. |
image | string | آدرس اینترنتی یا base64. برای مدلهای تصویر به تصویر و ویدیو. |
audio | string | آدرس یا base64 فایل صوتی. |
width / height | int | ابعاد خروجی؛ پیشفرض ۱۰۲۴ در ۱۰۲۴. |
duration | int | مدت به ثانیه، برای ویدیو و موسیقی. |
style | string | سبک کارتونی، فقط برای cartoon-convert. |
stem | string | vocal یا background، فقط برای vocal-separate. |
پاسخ — کد ۲۰۲
{
"id": "9f2c4b81-7d3e-4a11-9c02-5f8b1d2e6a44",
"model": "flux-dev",
"status": "processing",
"cost_toman": 500,
"balance_toman": 4500,
"output": null,
"poll_url": "https://api.appalpha.ir/v1/generations/9f2c4b81-…",
"created_at": 1755100000
}
گرفتن خروجی
هر سه تا پنج ثانیه یک بار بپرسید. سه حالت ممکن است برگردد:
| وضعیت | یعنی | کار بعدی |
|---|---|---|
processing | هنوز در حال ساخت است. | چند ثانیه صبر و دوباره بپرسید. |
ready | خروجی آماده است. | فایل را از output.url بردارید. |
failed | پردازش شکست خورد. | هزینه برگشته؛ میتوانید دوباره تلاش کنید. |
{
"id": "9f2c4b81-…",
"model": "flux-dev",
"status": "ready",
"cost_toman": 500,
"output": {
"url": "https://…/static/images/9f2c4b81-….png",
"type": "image"
}
}
فایلهای ورودی
هر فیلدی که فایل میگیرد، سه شکل ورودی را میپذیرد:
- آدرس اینترنتی — سادهترین راه. باید بدون نیاز به ورود قابل دانلود باشد.
- data URI — مثل
data:image/png;base64,iVBORw0… - base64 خام — بدون پیشوند؛ نوع فایل خودکار تشخیص داده میشود.
حداکثر حجم هر فایل ۴۰ مگابایت است. تصویر: png، jpg، webp. صدا: mp3، wav، ogg، m4a. ویدیو: mp4، webm، mov.
import base64, requests
with open("portrait.jpg", "rb") as f:
b64 = base64.b64encode(f.read()).decode()
requests.post(f"{BASE}/generations", headers=H, json={
"model": "video-wan22",
"image": f"data:image/jpeg;base64,{b64}",
"prompt": "دوربین آرام به جلو حرکت میکند",
})
موجودی
پیش از ارسال درخواستهای سنگین، موجودی را بررسی کنید تا کار وسط راه متوقف نشود.
{ "balance_toman": 240500, "requests": 128, "spent_toman": 359500 }
فهرست درخواستها
پنجاه درخواست آخر شما، از تازه به قدیم. برای بازیابی خروجیهایی که شناسهشان را گم کردهاید مفید است.
فهرست مدلها به شکل ماشینخوان
این مسیر کلید نمیخواهد. اگر قیمتها را داخل محصول خودتان نمایش میدهید، بهجای کپی کردن دستی از همین بگیرید.
فهرست مدلها
روی هر مدل بزنید تا فیلدهای ورودیاش باز شود. قیمتها به تومان و به ازای هر خروجی است.
فلاکس Dev flux-dev 1000 تومان برای هر 2 خروجی
مدل پایهی تولید تصویر با کیفیت بالا و پایبندی دقیق به متن. برای پوستر، محتوای شبکههای اجتماعی، تصویرسازی تبلیغاتی و کانسپتآرت.
فلاکس Dev انتخاب پیشفرض برای تصویر عمومی است: ترکیببندی درست، نورپردازی طبیعی و دنبال کردن دقیق جزئیاتی که در متن نوشتهاید. متن فارسی را مستقیم بفرستید؛ پیش از رسیدن به مدل خودکار ترجمه میشود.
| فیلد | نوع | لازم | پیشفرض | توضیح |
|---|---|---|---|---|
prompt |
string | بله | — | توضیح تصویر؛ فارسی یا انگلیسی. هرچه دقیقتر بنویسید نتیجه نزدیکتر است. |
width |
int | — |
1024
256 تا 2048 |
عرض تصویر به پیکسل |
height |
int | — |
1024
256 تا 2048 |
ارتفاع تصویر به پیکسل |
curl https://api.appalpha.ir/v1/generations \
-H "Authorization: Bearer $ALPHA_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "flux-dev", "prompt": "یک فنجان چای روی میز چوبی کنار پنجره، نور ملایم صبح"}'
ز ایمیج (Z-Image) z-image 1000 تومان برای هر 4 خروجی
سریعترین و ارزانترین مدل تصویر در آلفا. خروجی تمیز با تعداد مراحل کم، مناسب تولید انبوه تصویر، تست ایده و محصولاتی که حجم درخواست بالایی دارند.
ز ایمیج برای وقتی است که تعداد برایتان مهمتر از حداکثر جزئیات است: با یک چهارم قیمت فلاکس، در چند ثانیه خروجی میدهد. برای گالری محصول، تصویر شاخص مقاله و کاربردهای انبوه بهترین نسبت قیمت به کیفیت را دارد. نکته دربارهی ابعاد: این مدل بهجای عرض و ارتفاع آزاد، فهرستی از نسبتهای آماده دارد. عددی که میفرستید به نزدیکترین نسبت موجود نگاشت میشود، پس ممکن است خروجی دقیقاً همان پیکسل درخواستی نباشد.
| فیلد | نوع | لازم | پیشفرض | توضیح |
|---|---|---|---|---|
prompt |
string | بله | — | توضیح تصویر؛ فارسی یا انگلیسی. |
width |
int | — |
1024
256 تا 2048 |
عرض تصویر به پیکسل. سرور نزدیکترین نسبت تصویر موجود را انتخاب میکند. |
height |
int | — |
1024
256 تا 2048 |
ارتفاع تصویر به پیکسل. سرور نزدیکترین نسبت تصویر موجود را انتخاب میکند. |
curl https://api.appalpha.ir/v1/generations \
-H "Authorization: Bearer $ALPHA_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "z-image", "prompt": "پرترهی یک گربهی ایرانی سفید روی پسزمینهی آبی"}'
ساخت تصویر کارتونی cartoon-create 1000 تومان هر تصویر
از روی متن، تصویر کارتونی میسازد. سبک تخت و خطی با رنگهای شاد؛ برای کتاب کودک، استیکر، شخصیتپردازی و تصویرسازی آموزشی.
این مدل از صفر تصویر کارتونی میسازد و ورودی تصویری نمیگیرد. اگر میخواهید یک عکس واقعی را کارتونی کنید، بهجای این مدل از «تبدیل عکس به کارتون» استفاده کنید.
| فیلد | نوع | لازم | پیشفرض | توضیح |
|---|---|---|---|---|
prompt |
string | بله | — | توضیح صحنه یا شخصیت کارتونی؛ فارسی یا انگلیسی. |
width |
int | — |
1024
256 تا 2048 |
عرض تصویر به پیکسل |
height |
int | — |
1024
256 تا 2048 |
ارتفاع تصویر به پیکسل |
curl https://api.appalpha.ir/v1/generations \
-H "Authorization: Bearer $ALPHA_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "cartoon-create", "prompt": "یک روباه بامزه با کلاه قرمز در جنگل پاییزی"}'
تبدیل عکس به کارتون cartoon-convert 1000 تومان برای هر 2 خروجی
عکس واقعی را میگیرد و همان صحنه را با یکی از چهار سبک کارتونی بازسازی میکند: استودیو جیبلی، ایراسوتویا، سیمپسونها و اسنوپی.
چهار سبک این مدل، چهار مدل جداگانهی آموزشدیده هستند و با فیلد style انتخاب میشوند: • استودیو جیبلی — مقدار Studio Ghibli. رنگهای نرم و آبرنگی، پسزمینهی پرجزئیات، حالوهوای انیمیشنهای ژاپنی. بهترین انتخاب برای پرتره و منظره. • ایراسوتویا — مقدار Irasutoya Illustration. تصویرسازی ساده و تخت ژاپنی با خطوط تمیز و بدون سایه. مناسب آیکون، اینفوگرافیک و محتوای آموزشی. • سیمپسونها — مقدار The Simpsons. سبک زرد و اغراقشدهی سریال سیمپسونها. برای پرترهی طنز و آواتار شبکههای اجتماعی. • اسنوپی — مقدار Snoopy. سبک کمیکاستریپ کلاسیک با خطهای نازک و رنگ محدود. برای کارت تبریک و تصویرسازی مینیمال. بهترین نتیجه با عکسی به دست میآید که سوژه در آن واضح و نور کافی باشد.
| فیلد | نوع | لازم | پیشفرض | توضیح |
|---|---|---|---|---|
image |
file
image |
بله | — | عکس ورودی که باید کارتونی شود. |
style |
select | — |
Studio Ghibli
|
کدامیک از چهار مدل کارتونی اعمال شود.
مقادیر مجاز: Studio Ghibli · Irasutoya Illustration · The Simpsons · Snoopy
|
curl https://api.appalpha.ir/v1/generations \
-H "Authorization: Bearer $ALPHA_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "cartoon-convert", "image": "https://example.com/photo.jpg", "style": "Studio Ghibli"}'
ویرایش تصویر qwen-image-edit 999 تومان برای هر 3 خروجی
تصویر را با یک جمله ویرایش میکند: تعویض پسزمینه، تغییر لباس و رنگ، حذف یا اضافه کردن شیء، تغییر حالت چهره و ترکیب چند تصویر در یک صحنه.
تنها موتور ویرایش آلفا Qwen Image Edit است و انتخاب دیگری وجود ندارد. دستور را مثل حرف زدن با یک طراح بنویسید: «پسزمینه را به ساحل غروب تغییر بده» یا «کت مشکی را به کت چرم قهوهای عوض کن». میتوانید تا سه تصویر بفرستید تا عناصرشان را با هم ترکیب کند.
| فیلد | نوع | لازم | پیشفرض | توضیح |
|---|---|---|---|---|
prompt |
string | بله | — | دستور ویرایش، مثلاً «پسزمینه را به ساحل تغییر بده». |
image |
file
image |
بله | — | تصویر اصلی که باید ویرایش شود. |
image2 |
file
image |
— | — | تصویر دوم برای ترکیب (اختیاری). |
image3 |
file
image |
— | — | تصویر سوم برای ترکیب (اختیاری). |
curl https://api.appalpha.ir/v1/generations \
-H "Authorization: Bearer $ALPHA_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "qwen-image-edit", "prompt": "پسزمینه را به ساحل غروب تغییر بده", "image": "https://example.com/photo.jpg"}'
گسترش تصویر image-expand 1000 تومان برای هر 2 خروجی
کادر تصویر را به هر سمتی که بخواهید باز میکند و بخش تازه را متناسب با خودِ عکس میسازد. برای تبدیل عکس عمودی به افقی، ساخت بنر و پر کردن حاشیه.
همهی تنظیمات این مدل در اختیار شماست: • directions — جهتهای گسترش. هر ترکیبی از left، right، top و bottom. پیشفرض چپ و راست است. اگر میخواهید عکس عمودی افقی شود فقط left و right را بدهید. • size — اندازهی نهایی، یکی از چهار حالت آماده: مربع ۱۰۲۴×۱۰۲۴، افقی ۱۲۸۰×۷۲۰، عمودی ۷۲۰×۱۲۸۰ یا افقی ۱۰۲۴×۷۶۸. اندازه باید در جهتی که انتخاب کردهاید بزرگتر از عکس اصلی باشد وگرنه چیزی اضافه نمیشود؛ مثلاً برای افقی کردن یک عکس عمودی، ۱۲۸۰×۷۲۰ را با جهتهای چپ و راست بگیرید. • steps — تعداد مراحل تولید، بین ۴ تا ۱۲. عدد بالاتر یعنی ناحیهی جدید پرجزئیاتتر و زمان بیشتر. پیشفرض ۸ برای بیشتر عکسها کافی است. • prompt — اختیاری. اگر خالی بگذارید، مدل خودش ادامهی منطقی صحنه را میسازد. اگر بنویسید «ادامهی ساحل و آسمان ابری»، ناحیهی جدید را طبق همان میسازد.
| فیلد | نوع | لازم | پیشفرض | توضیح |
|---|---|---|---|---|
image |
file
image |
بله | — | تصویر ورودی که باید کادرش باز شود. |
directions |
multiselect | — |
left, right
|
جهتهایی که تصویر در آنها گسترش پیدا میکند.
مقادیر مجاز: left · right · top · bottom
|
size |
select | — |
1024x1024
|
اندازهی نهایی تصویر بعد از گسترش.
مقادیر مجاز: 1024x1024 · 1280x720 · 720x1280 · 1024x768
|
steps |
int | — |
8
4 تا 12 |
تعداد مراحل تولید؛ بیشتر یعنی دقیقتر و کندتر |
prompt |
string | — | — | توضیح اختیاری برای ناحیهی جدید. خالی بگذارید تا خودکار تصمیم بگیرد. |
curl https://api.appalpha.ir/v1/generations \
-H "Authorization: Bearer $ALPHA_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "image-expand", "image": "https://example.com/photo.jpg", "directions": ["left", "right"], "size": "1024x1024", "prompt": "ادامهی ساحل و آسمان ابری"}'
ویدیو Wan 2.2 (۱۴B) video-wan22 5000 تومان هر ویدیو
یک تصویر ثابت را به کلیپ متحرک تبدیل میکند، با حرکت دوربین و حرکت طبیعی سوژه. دستور شما پیش از ساخت، خودکار به یک دستور سینمایی حرفهای بازنویسی میشود.
این مدل دو مرحله دارد و هر دو در همین یک درخواست انجام میشود: ۱) ساخت دستور سینمایی — متن سادهی شما (مثلاً «دوربین جلو بره») همراه با خودِ تصویر به یک مدل زبانی داده میشود که تصویر را میبیند و یک دستور کامل سینمایی مینویسد: حرکت دوربین، لنز، نورپردازی، ریتم و جزئیات حرکت سوژه. ۲) ساخت ویدیو — دستور بازنویسیشده به Wan 2.2 داده میشود. اگر خودتان دستور انگلیسی دقیقی دارید، cinematic را false بگذارید تا متن شما دستنخورده استفاده شود. دستور نهایی همیشه در خروجی زیر کلید cinematic_prompt برگردانده میشود.
| فیلد | نوع | لازم | پیشفرض | توضیح |
|---|---|---|---|---|
image |
file
image |
بله | — | تصویر شروع ویدیو. کیفیت این عکس مستقیماً روی کیفیت ویدیو اثر دارد. |
prompt |
string | — | — | توضیح حرکت دلخواه؛ فارسی کافی است. مثلاً «دوربین آرام به سوژه نزدیک میشود». |
cinematic |
bool | — |
true
|
بازنویسی خودکار دستور به سبک سینمایی |
curl https://api.appalpha.ir/v1/generations \
-H "Authorization: Bearer $ALPHA_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "video-wan22", "image": "https://example.com/photo.jpg", "prompt": "دوربین آرام به سوژه نزدیک میشود"}'
LTX-2.3 با صدای فارسی video-ltx-voice 8000 تومان هر ویدیو
ویدیوی باکیفیت که صدا هم تولید میکند. دیالوگ فارسی را داخل گیومه بنویسید تا شخصیت همان جمله را به فارسی بگوید.
LTX-2.3 برخلاف بیشتر مدلهای ویدیو، صدا را همزمان با تصویر میسازد. در این نسخه، متن شما دقیقاً همانطور که نوشتهاید و بدون هیچ ترجمه یا دستکاری به مدل میرسد؛ به همین دلیل جملههای فارسی سالم میمانند و شخصیت آنها را با تلفظ فارسی ادا میکند. روش نوشتن: صحنه را توصیف کنید و دیالوگ را داخل گیومه بگذارید. مثال: مرد میانسال پشت میز چوبی نشسته، نور پنجره از سمت راست، میگوید: «سلام، خوش آمدید». اگر تصویر شروع بدهید، ویدیو از همان تصویر ساخته میشود؛ اگر ندهید، کاملاً از متن.
| فیلد | نوع | لازم | پیشفرض | توضیح |
|---|---|---|---|---|
prompt |
string | بله | — | توضیح صحنه بههمراه دیالوگ فارسی داخل گیومه. |
image |
file
image |
— | — | تصویر شروع (اختیاری). بدون آن، ویدیو از روی متن ساخته میشود. |
duration |
int | — |
8
1 تا 18 |
مدت ویدیو به ثانیه |
width |
int | — |
1280
512 تا 1920 |
عرض ویدیو به پیکسل |
height |
int | — |
720
512 تا 1920 |
ارتفاع ویدیو به پیکسل |
curl https://api.appalpha.ir/v1/generations \
-H "Authorization: Bearer $ALPHA_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "video-ltx-voice", "prompt": "مرد میانسال پشت میز چوبی نشسته، میگوید: «سلام، خوش آمدید»"}'
LTX-2.3 بهینهشده برای فارسی video-ltx-fa 8000 تومان هر ویدیو
همان موتور LTX-2.3، اما توضیح صحنه پیش از ساخت به انگلیسی سینمایی بازنویسی میشود و فقط دیالوگهای داخل گیومه فارسی باقی میمانند.
تفاوت این نسخه با نسخهی «صدای فارسی» فقط در پردازش متن است، نه در موتور: • نسخهی صدای فارسی متن را دستنخورده میفرستد. اگر انگلیسی سینمایی بلدید بهتر است. • این نسخه توضیح صحنهی فارسی شما را به انگلیسی برمیگرداند و بهینهساز داخلی مدل را هم روشن میکند، ولی هر چیزی که داخل گیومه نوشتهاید را دست نمیزند. یعنی صحنه دقیقتر ساخته میشود و دیالوگ همچنان فارسی گفته میشود. اگر کلاً فارسی مینویسید و نمیخواهید درگیر جزئیات انگلیسی شوید، همین نسخه را انتخاب کنید.
| فیلد | نوع | لازم | پیشفرض | توضیح |
|---|---|---|---|---|
prompt |
string | بله | — | توضیح صحنه به فارسی. دیالوگها را داخل گیومه بگذارید تا فارسی بمانند. |
image |
file
image |
— | — | تصویر شروع (اختیاری). |
duration |
int | — |
8
1 تا 18 |
مدت ویدیو به ثانیه |
width |
int | — |
1280
512 تا 1920 |
عرض ویدیو به پیکسل |
height |
int | — |
720
512 تا 1920 |
ارتفاع ویدیو به پیکسل |
curl https://api.appalpha.ir/v1/generations \
-H "Authorization: Bearer $ALPHA_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "video-ltx-fa", "prompt": "زن جوانی در کافهای شلوغ لبخند میزند و میگوید: «قهوهات آمادهست»"}'
تغییر صدا با مدل آلفا alpha-change-voice 1000 تومان برای هر 2 خروجی
نمونهی صدای خودتان و نمونهی صدای مدل را میدهید؛ صدای شما با حفظ همان جملهها و لحن، به صدای آن مدل تبدیل میشود.
این یک مدل توسعهدادهشده توسط تیم آلفاست؛ یک مدل فوقالعاده پیشرفته که بدون نیاز به سیستمهای قدیمی RVC، فقط با یک نمونه صدا هر صدایی را با کیفیت بالا به همان صدا تبدیل میکند. در روش قدیمی RVC برای هر صدای مقصد باید یک مدل جداگانه آموزش میدادید: ساعتها پردازش، دهها دقیقه دیتای صوتی، و یک فایل مدل چندصد مگابایتی که باید جایی نگه داشته میشد. اینجا هیچکدام لازم نیست. یک فایل صوتی کوتاه از صدای مقصد کافی است و همان لحظه تبدیل انجام میشود. از این مدل میتوانید برای وبسایتهای تغییر صدا استفاده کنید و هر چقدر مدل که خواستید با یک نمونه صدا بسازید، یا ساخت مدل را کلاً سمت کاربران خودتان بگذارید: کاربر شما فایل صدای دلخواهش را آپلود میکند و بدون هیچ مرحلهی آموزشی، بلافاصله صاحب یک «مدل صدا» میشود. دو ورودی لازم است: • source_audio — فایلی که محتوای گفتار را دارد؛ همان جملههایی که باید شنیده شود. • reference_audio — نمونهی صدای مقصد؛ فقط برای اینکه مدل بفهمد خروجی باید چه جنس صدایی داشته باشد. حدود ده ثانیهی تمیز و بدون نویز بهترین نتیجه را میدهد.
| فیلد | نوع | لازم | پیشفرض | توضیح |
|---|---|---|---|---|
source_audio |
file
audio |
بله | — | فایل صدای اصلی؛ همان جملههایی که باید شنیده شود. |
reference_audio |
file
audio |
بله | — | نمونهی صدای مدل مقصد؛ حدود ده ثانیهی تمیز کافی است. |
curl https://api.appalpha.ir/v1/generations \
-H "Authorization: Bearer $ALPHA_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "alpha-change-voice", "source_audio": "https://example.com/voice.mp3", "reference_audio": "https://example.com/voice.mp3"}'
تقویت صدا voice-enhance 1000 تومان برای هر 2 خروجی
نویز پسزمینه و پژواک را حذف میکند و وضوح گفتار را بالا میبرد. برای ضبط با موبایل، جلسهی آنلاین و پادکست خانگی.
فایلهای بلندتر از یک دقیقه خودکار از روی نقاط سکوت برش میخورند، تکهتکه پردازش میشوند و دوباره به هم میچسبند؛ پس لازم نیست خودتان فایل را تکه کنید. گزینهی denoise را روشن بگذارید مگر اینکه فقط میخواهید وضوح بالا برود و نویز محیط عمداً حفظ شود.
| فیلد | نوع | لازم | پیشفرض | توضیح |
|---|---|---|---|---|
audio |
file
audio |
بله | — | فایل صوتی ورودی با هر فرمتی. |
denoise |
bool | — |
true
|
حذف نویز پیش از تقویت |
curl https://api.appalpha.ir/v1/generations \
-H "Authorization: Bearer $ALPHA_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "voice-enhance", "audio": "https://example.com/voice.mp3"}'
جداسازی صدای خواننده از موزیک vocal-separate 1000 تومان هر جداسازی
آهنگ را میگیرد و یا فقط صدای خواننده را برمیگرداند یا فقط موسیقی بیکلام را. برای کارائوکه، ریمیکس، کاور خوانی و نمونهبرداری.
خروجی این مدل با فیلد stem مشخص میشود و هر بار فقط یکی از دو حالت را میدهد: • برای گرفتن ووکال (صدای خواننده): مقدار stem را vocal بگذارید. خروجی فقط صدای خواننده است، بدون ساز و بدون بیت. اگر میخواهید روی یک بیت دیگر بگذاریدش یا متن آهنگ را پیاده کنید، همین حالت را بخواهید. • برای گرفتن پسزمینه (موسیقی بیکلام): مقدار stem را background بگذارید. خروجی همان آهنگ بدون صدای خواننده است؛ یعنی نسخهی کارائوکه. برای کاور خواندن یا استفاده بهعنوان موسیقی متن همین را بخواهید. اگر هر دو را لازم دارید باید دو درخواست جدا بفرستید و هزینهی هر کدام جداگانه حساب میشود. فیلد format فرمت فایل خروجی را تعیین میکند: WAV کیفیت کامل و بدون افت، MP3 حجم کمتر، FLAC فشردهی بدون افت. برای پردازشهای بعدی WAV را انتخاب کنید. بهترین نتیجه از فایل اصلی و باکیفیت آهنگ به دست میآید؛ فایلی که خودش قبلاً چند بار فشرده شده، خروجی مبهمتری میدهد.
| فیلد | نوع | لازم | پیشفرض | توضیح |
|---|---|---|---|---|
audio |
file
audio |
بله | — | فایل آهنگ ورودی. |
stem |
select | — |
vocal
|
کدام بخش برگردانده شود.
مقادیر مجاز: vocal · background
|
format |
select | — |
WAV
|
فرمت فایل خروجی.
مقادیر مجاز: WAV · MP3 · FLAC
|
dereverb |
bool | — |
false
|
حذف پژواک و اکوی سالن پیش از جداسازی |
curl https://api.appalpha.ir/v1/generations \
-H "Authorization: Bearer $ALPHA_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "vocal-separate", "audio": "https://example.com/voice.mp3", "stem": "vocal", "format": "WAV"}'
ساخت آهنگ music-create 2000 تومان هر آهنگ
از روی توضیح سبک و متن ترانه، یک قطعهی کامل با خواننده یا بیکلام میسازد. خواندن فارسی پشتیبانی میشود.
سبک را در prompt توصیف کنید (ساز، تمپو، حالوهوا، کیفیت ضبط) و متن ترانه را در lyrics بگذارید. توضیح سبک خودکار به انگلیسی ترجمه میشود، اما متن ترانه دقیقاً همان چیزی میماند که نوشتهاید تا خواننده ترجمهی ترانه را نخواند. برای آهنگ فارسی، language را روی fa بگذارید. برای قطعهی بیکلام، instrumental را true کنید؛ در این حالت lyrics نادیده گرفته میشود. فیلدهای bpm، key و time_signature اختیاریاند؛ اگر خالی بگذارید مدل خودش متناسب با سبک تصمیم میگیرد.
| فیلد | نوع | لازم | پیشفرض | توضیح |
|---|---|---|---|---|
prompt |
string | بله | — | توضیح سبک و حالوهوا؛ مثلاً «پاپ ایرانی، گیتار آکوستیک، تمپوی آرام». |
lyrics |
string | — | — | متن ترانه. برای قطعهی بیکلام خالی بگذارید. |
language |
select | — |
fa
|
زبان خواندن.
مقادیر مجاز: fa · en · ar · tr
|
instrumental |
bool | — |
false
|
بیکلام؛ بدون خواننده |
duration |
int | — |
120
15 تا 240 |
مدت قطعه به ثانیه |
steps |
int | — |
27
10 تا 60 |
تعداد مراحل تولید؛ بیشتر یعنی باکیفیتتر و کندتر |
format |
select | — |
mp3
|
فرمت فایل خروجی.
مقادیر مجاز: mp3 · wav
|
curl https://api.appalpha.ir/v1/generations \
-H "Authorization: Bearer $ALPHA_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "music-create", "prompt": "پاپ ایرانی، گیتار آکوستیک، تمپوی آرام و حالوهوای دلنشین", "lyrics": "شب که میشود ستارهها\nراه خانه را نشان میدهند", "language": "fa", "format": "mp3"}'
نحوهی محاسبه
قیمتگذاری بر پایهی تعداد خروجی است، نه توکن. یک تصویر یعنی یک بار قیمت همان مدل؛
طول پرامپت هیچ تأثیری روی مبلغ ندارد. مبلغ در همان لحظهی ثبت درخواست از کیف پول کم میشود
و در پاسخ با نام cost_toman برمیگردد.
- پردازش موفق ← مبلغ نهایی میشود.
- پردازش ناموفق ← مبلغ کامل همان لحظه برمیگردد و در گردش حساب ثبت میشود.
- خطای اعتبارسنجی پیش از ارسال به موتور ← هیچ مبلغی کسر نمیشود.
بعضی مدلها بستهای معرفی شدهاند (مثلاً «هر دو تصویر ۱٬۰۰۰ تومان»). این فقط شکل نمایش است؛ در عمل هر درخواست جداگانه و به قیمت یک خروجی حساب میشود و لازم نیست حتماً بسته را کامل کنید.
نرخ مرجع تبدیل برای مقایسه با سرویسهای خارجی: هر دلار 190000 تومان. قیمتهای آلفا عمداً پایینتر از پایینترین تعرفهی موجود در بازار تنظیم شده است.
کدهای خطا
خطاها همیشه با همین ساختار برمیگردند:
{ "error": { "message": "اعتبار کافی نیست…", "code": "insufficient_credit" } }
| کد | معنی | کار بعدی |
|---|---|---|
400 | یکی از فیلدهای لازم نیامده یا مقدارش پذیرفته نشده. | پیام خطا نام دقیق فیلد را میگوید. |
401 | کلید نیامده، نامعتبر است یا لغو شده. | هدر Authorization و وضعیت کلید را بررسی کنید. |
402 | موجودی کیف پول کمتر از هزینهی درخواست است. | اعتبار شارژ کنید. |
404 | مدل یا شناسهی درخواست پیدا نشد. | شناسهی مدل را از /v1/models بگیرید. |
413 | حجم فایل ورودی بیش از حد مجاز است. | فایل را زیر ۴۰ مگابایت فشرده کنید. |
502 / 503 | سرور موقتاً در دسترس نیست. | با فاصلهی فزاینده دوباره تلاش کنید. مبلغی کسر نشده. |
پرسشها
پشتیبانی از کجاست؟
پشتیبانی فقط از طریق تلگرام انجام میشود: @App_alpha_support. شارژ اعتبار، رزرو ظرفیت و گزارش مشکل همه از همین کانال انجام میشود.
چند درخواست همزمان میتوانم بفرستم؟
سقف سختی تعیین نشده، اما ارسال دهها درخواست موازی صف را کند میکند. برای بار سنگین، یک صف داخلی بگذارید و پیش از شروع در تلگرام هماهنگ کنید.
خروجی تا چه زمانی در دسترس است؟
آدرس خروجی برای دانلود فوری در نظر گرفته شده. بلافاصله بعد از آماده شدن، فایل را روی فضای خودتان کپی کنید.
میشود درخواست را لغو کرد؟
فعلاً نه. وقتی درخواست وارد صف شد تا پایان اجرا میشود. اگر شکست بخورد، هزینه خودکار برمیگردد.
پرامپت فارسی چطور پردازش میشود؟
در بیشتر مدلها پیش از رسیدن به مدل به انگلیسی ترجمه میشود. دو استثنا وجود دارد: در video-ltx-voice متن اصلاً دستنخورده میرود تا دیالوگ فارسی سالم بماند، و در video-ltx-fa فقط توضیح صحنه ترجمه میشود و هرچه داخل گیومه باشد فارسی میماند. در music-create هم توضیح سبک ترجمه میشود اما متن ترانه هرگز.