api.appalpha.ir
مرجع API · نسخه‌ی ۱

مستندات API آلفا

آلفا ارزان‌ترین ارائه‌دهنده‌ی API هوش مصنوعی در تمام اینترنت است و همه‌ی 13 مدل از یک مسیر واحد صدا زده می‌شوند. یک درخواست POST می‌فرستید، یک شناسه می‌گیرید، و تا آماده شدن خروجی وضعیت را می‌پرسید. تمام پاسخ‌ها JSON هستند.

BASEhttps://api.appalpha.ir/v1
سه چیز که خوب است از ابتدا بدانید.
یک: پردازش‌ها ناهم‌زمان‌اند و همیشه باید وضعیت را پرسید.
دو: هزینه در همان لحظه‌ی ثبت درخواست رزرو می‌شود و اگر پردازش شکست بخورد کامل برمی‌گردد.
سه: متن فارسی را مستقیم بفرستید؛ ترجمه‌ی داخلی خودکار انجام می‌شود.

احراز هویت

هر درخواست باید کلید شما را در هدر Authorization با پیشوند Bearer داشته باشد. کلیدها از پنل کاربری ساخته و لغو می‌شوند.

header
Authorization: Bearer ak_live_xxxxxxxxxxxxxxxxxxxx

اگر کتابخانه‌ی شما هدر سفارشی راحت‌تر است، X-API-Key هم پذیرفته می‌شود.

کلید را سمت مرورگر نگذارید. هر کسی کلید را داشته باشد می‌تواند از اعتبار شما خرج کند. درخواست‌ها را از سرور خودتان بفرستید و کلید را در متغیر محیطی نگه دارید. اگر کلیدی لو رفت، از پنل لغوش کنید؛ بقیه‌ی کلیدها بدون وقفه کار می‌کنند.

اولین درخواست

این نمونه یک تصویر می‌سازد و تا آماده شدن منتظر می‌ماند.

python
import os, time, requests

BASE = "https://api.appalpha.ir/v1"
H = {"Authorization": f"Bearer {os.environ['ALPHA_KEY']}"}

job = requests.post(f"{BASE}/generations", headers=H, json={
    "model": "flux-dev",
    "prompt": "یک باغ ایرانی در بهار، نور طلایی عصر",
    "width": 1024,
    "height": 1024,
}).json()

print(job["id"], job["cost_toman"])

while True:
    time.sleep(3)
    out = requests.get(f"{BASE}/generations/{job['id']}", headers=H).json()
    if out["status"] != "processing":
        break

if out["status"] == "ready":
    print(out["output"]["url"])
else:
    print("خطا:", out["error"]["message"])

ساخت درخواست

POST/v1/generations

فیلد model همیشه لازم است. بقیه‌ی فیلدها به مدل انتخابی بستگی دارند و در فهرست مدل‌ها برای هر کدام جداگانه آمده است.

فیلدنوعتوضیح
modelstringشناسه‌ی مدل، مثلاً flux-dev. الزامی.
promptstringتوضیح خروجی. فارسی یا انگلیسی.
imagestringآدرس اینترنتی یا base64. برای مدل‌های تصویر به تصویر و ویدیو.
audiostringآدرس یا base64 فایل صوتی.
width / heightintابعاد خروجی؛ پیش‌فرض ۱۰۲۴ در ۱۰۲۴.
durationintمدت به ثانیه، برای ویدیو و موسیقی.
stylestringسبک کارتونی، فقط برای cartoon-convert.
stemstringvocal یا background، فقط برای vocal-separate.

پاسخ — کد ۲۰۲

json
{
  "id": "9f2c4b81-7d3e-4a11-9c02-5f8b1d2e6a44",
  "model": "flux-dev",
  "status": "processing",
  "cost_toman": 500,
  "balance_toman": 4500,
  "output": null,
  "poll_url": "https://api.appalpha.ir/v1/generations/9f2c4b81-…",
  "created_at": 1755100000
}

گرفتن خروجی

GET/v1/generations/{id}

هر سه تا پنج ثانیه یک بار بپرسید. سه حالت ممکن است برگردد:

وضعیتیعنیکار بعدی
processingهنوز در حال ساخت است.چند ثانیه صبر و دوباره بپرسید.
readyخروجی آماده است.فایل را از output.url بردارید.
failedپردازش شکست خورد.هزینه برگشته؛ می‌توانید دوباره تلاش کنید.
json — ready
{
  "id": "9f2c4b81-…",
  "model": "flux-dev",
  "status": "ready",
  "cost_toman": 500,
  "output": {
    "url": "https://…/static/images/9f2c4b81-….png",
    "type": "image"
  }
}
فایل خروجی را نزد خودتان نگه دارید. آدرس خروجی برای دانلود فوری است، نه بایگانی دائمی. بلافاصله بعد از آماده شدن، فایل را روی فضای ذخیره‌سازی خودتان کپی کنید.

فایل‌های ورودی

هر فیلدی که فایل می‌گیرد، سه شکل ورودی را می‌پذیرد:

حداکثر حجم هر فایل ۴۰ مگابایت است. تصویر: png، jpg، webp. صدا: mp3، wav، ogg، m4a. ویدیو: mp4، webm، mov.

python — base64
import base64, requests

with open("portrait.jpg", "rb") as f:
    b64 = base64.b64encode(f.read()).decode()

requests.post(f"{BASE}/generations", headers=H, json={
    "model": "video-wan22",
    "image": f"data:image/jpeg;base64,{b64}",
    "prompt": "دوربین آرام به جلو حرکت می‌کند",
})

موجودی

GET/v1/balance

پیش از ارسال درخواست‌های سنگین، موجودی را بررسی کنید تا کار وسط راه متوقف نشود.

json
{ "balance_toman": 240500, "requests": 128, "spent_toman": 359500 }

فهرست درخواست‌ها

GET/v1/generations

پنجاه درخواست آخر شما، از تازه به قدیم. برای بازیابی خروجی‌هایی که شناسه‌شان را گم کرده‌اید مفید است.

فهرست مدل‌ها به شکل ماشین‌خوان

GET/v1/models

این مسیر کلید نمی‌خواهد. اگر قیمت‌ها را داخل محصول خودتان نمایش می‌دهید، به‌جای کپی کردن دستی از همین بگیرید.


فهرست مدل‌ها

روی هر مدل بزنید تا فیلدهای ورودی‌اش باز شود. قیمت‌ها به تومان و به ازای هر خروجی است.

ساخت تصویر — متن به تصویر و کارتونی‌سازی
فلاکس Dev flux-dev 1000 تومان برای هر 2 خروجی

مدل پایه‌ی تولید تصویر با کیفیت بالا و پایبندی دقیق به متن. برای پوستر، محتوای شبکه‌های اجتماعی، تصویرسازی تبلیغاتی و کانسپت‌آرت.

قیمت‌گذاری بسته‌ای. هر خروجی 500 تومان حساب می‌شود؛ یعنی 2 خروجی روی هم 1000 تومان. کسر اعتبار در همان لحظه و به ازای هر درخواست انجام می‌شود، نه به شکل بسته‌ای.

فلاکس Dev انتخاب پیش‌فرض برای تصویر عمومی است: ترکیب‌بندی درست، نورپردازی طبیعی و دنبال کردن دقیق جزئیاتی که در متن نوشته‌اید. متن فارسی را مستقیم بفرستید؛ پیش از رسیدن به مدل خودکار ترجمه می‌شود.

فیلدنوعلازمپیش‌فرضتوضیح
prompt string بله توضیح تصویر؛ فارسی یا انگلیسی. هرچه دقیق‌تر بنویسید نتیجه نزدیک‌تر است.
width int 1024
256 تا 2048
عرض تصویر به پیکسل
height int 1024
256 تا 2048
ارتفاع تصویر به پیکسل
موتور: FLUX.1-dev
curl https://api.appalpha.ir/v1/generations \
  -H "Authorization: Bearer $ALPHA_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model": "flux-dev", "prompt": "یک فنجان چای روی میز چوبی کنار پنجره، نور ملایم صبح"}'
ز ایمیج (Z-Image) z-image 1000 تومان برای هر 4 خروجی

سریع‌ترین و ارزان‌ترین مدل تصویر در آلفا. خروجی تمیز با تعداد مراحل کم، مناسب تولید انبوه تصویر، تست ایده و محصولاتی که حجم درخواست بالایی دارند.

قیمت‌گذاری بسته‌ای. هر خروجی 250 تومان حساب می‌شود؛ یعنی 4 خروجی روی هم 1000 تومان. کسر اعتبار در همان لحظه و به ازای هر درخواست انجام می‌شود، نه به شکل بسته‌ای.

ز ایمیج برای وقتی است که تعداد برایتان مهم‌تر از حداکثر جزئیات است: با یک چهارم قیمت فلاکس، در چند ثانیه خروجی می‌دهد. برای گالری محصول، تصویر شاخص مقاله و کاربردهای انبوه بهترین نسبت قیمت به کیفیت را دارد. نکته درباره‌ی ابعاد: این مدل به‌جای عرض و ارتفاع آزاد، فهرستی از نسبت‌های آماده دارد. عددی که می‌فرستید به نزدیک‌ترین نسبت موجود نگاشت می‌شود، پس ممکن است خروجی دقیقاً همان پیکسل درخواستی نباشد.

فیلدنوعلازمپیش‌فرضتوضیح
prompt string بله توضیح تصویر؛ فارسی یا انگلیسی.
width int 1024
256 تا 2048
عرض تصویر به پیکسل. سرور نزدیک‌ترین نسبت تصویر موجود را انتخاب می‌کند.
height int 1024
256 تا 2048
ارتفاع تصویر به پیکسل. سرور نزدیک‌ترین نسبت تصویر موجود را انتخاب می‌کند.
موتور: Z-Image Turbo
curl https://api.appalpha.ir/v1/generations \
  -H "Authorization: Bearer $ALPHA_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model": "z-image", "prompt": "پرتره‌ی یک گربه‌ی ایرانی سفید روی پس‌زمینه‌ی آبی"}'
ساخت تصویر کارتونی cartoon-create 1000 تومان هر تصویر

از روی متن، تصویر کارتونی می‌سازد. سبک تخت و خطی با رنگ‌های شاد؛ برای کتاب کودک، استیکر، شخصیت‌پردازی و تصویرسازی آموزشی.

این مدل از صفر تصویر کارتونی می‌سازد و ورودی تصویری نمی‌گیرد. اگر می‌خواهید یک عکس واقعی را کارتونی کنید، به‌جای این مدل از «تبدیل عکس به کارتون» استفاده کنید.

فیلدنوعلازمپیش‌فرضتوضیح
prompt string بله توضیح صحنه یا شخصیت کارتونی؛ فارسی یا انگلیسی.
width int 1024
256 تا 2048
عرض تصویر به پیکسل
height int 1024
256 تا 2048
ارتفاع تصویر به پیکسل
موتور: Flux Long-Toon LoRA
curl https://api.appalpha.ir/v1/generations \
  -H "Authorization: Bearer $ALPHA_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model": "cartoon-create", "prompt": "یک روباه بامزه با کلاه قرمز در جنگل پاییزی"}'
تبدیل عکس به کارتون cartoon-convert 1000 تومان برای هر 2 خروجی

عکس واقعی را می‌گیرد و همان صحنه را با یکی از چهار سبک کارتونی بازسازی می‌کند: استودیو جیبلی، ایراسوتویا، سیمپسون‌ها و اسنوپی.

قیمت‌گذاری بسته‌ای. هر خروجی 500 تومان حساب می‌شود؛ یعنی 2 خروجی روی هم 1000 تومان. کسر اعتبار در همان لحظه و به ازای هر درخواست انجام می‌شود، نه به شکل بسته‌ای.

چهار سبک این مدل، چهار مدل جداگانه‌ی آموزش‌دیده هستند و با فیلد style انتخاب می‌شوند: • استودیو جیبلی — مقدار Studio Ghibli. رنگ‌های نرم و آبرنگی، پس‌زمینه‌ی پرجزئیات، حال‌وهوای انیمیشن‌های ژاپنی. بهترین انتخاب برای پرتره و منظره. • ایراسوتویا — مقدار Irasutoya Illustration. تصویرسازی ساده و تخت ژاپنی با خطوط تمیز و بدون سایه. مناسب آیکون، اینفوگرافیک و محتوای آموزشی. • سیمپسون‌ها — مقدار The Simpsons. سبک زرد و اغراق‌شده‌ی سریال سیمپسون‌ها. برای پرتره‌ی طنز و آواتار شبکه‌های اجتماعی. • اسنوپی — مقدار Snoopy. سبک کمیک‌استریپ کلاسیک با خط‌های نازک و رنگ محدود. برای کارت تبریک و تصویرسازی مینیمال. بهترین نتیجه با عکسی به دست می‌آید که سوژه در آن واضح و نور کافی باشد.

فیلدنوعلازمپیش‌فرضتوضیح
image file
image
بله عکس ورودی که باید کارتونی شود.
style select Studio Ghibli کدام‌یک از چهار مدل کارتونی اعمال شود.
مقادیر مجاز: Studio Ghibli · Irasutoya Illustration · The Simpsons · Snoopy
موتور: OminiControl Art
curl https://api.appalpha.ir/v1/generations \
  -H "Authorization: Bearer $ALPHA_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model": "cartoon-convert", "image": "https://example.com/photo.jpg", "style": "Studio Ghibli"}'
ویرایش تصویر — ویرایش و گسترش کادر
ویرایش تصویر qwen-image-edit 999 تومان برای هر 3 خروجی

تصویر را با یک جمله ویرایش می‌کند: تعویض پس‌زمینه، تغییر لباس و رنگ، حذف یا اضافه کردن شیء، تغییر حالت چهره و ترکیب چند تصویر در یک صحنه.

قیمت‌گذاری بسته‌ای. هر خروجی 333 تومان حساب می‌شود؛ یعنی 3 خروجی روی هم 999 تومان. کسر اعتبار در همان لحظه و به ازای هر درخواست انجام می‌شود، نه به شکل بسته‌ای.

تنها موتور ویرایش آلفا Qwen Image Edit است و انتخاب دیگری وجود ندارد. دستور را مثل حرف زدن با یک طراح بنویسید: «پس‌زمینه را به ساحل غروب تغییر بده» یا «کت مشکی را به کت چرم قهوه‌ای عوض کن». می‌توانید تا سه تصویر بفرستید تا عناصرشان را با هم ترکیب کند.

فیلدنوعلازمپیش‌فرضتوضیح
prompt string بله دستور ویرایش، مثلاً «پس‌زمینه را به ساحل تغییر بده».
image file
image
بله تصویر اصلی که باید ویرایش شود.
image2 file
image
تصویر دوم برای ترکیب (اختیاری).
image3 file
image
تصویر سوم برای ترکیب (اختیاری).
موتور: Qwen Image Edit
curl https://api.appalpha.ir/v1/generations \
  -H "Authorization: Bearer $ALPHA_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model": "qwen-image-edit", "prompt": "پس‌زمینه را به ساحل غروب تغییر بده", "image": "https://example.com/photo.jpg"}'
گسترش تصویر image-expand 1000 تومان برای هر 2 خروجی

کادر تصویر را به هر سمتی که بخواهید باز می‌کند و بخش تازه را متناسب با خودِ عکس می‌سازد. برای تبدیل عکس عمودی به افقی، ساخت بنر و پر کردن حاشیه.

قیمت‌گذاری بسته‌ای. هر خروجی 500 تومان حساب می‌شود؛ یعنی 2 خروجی روی هم 1000 تومان. کسر اعتبار در همان لحظه و به ازای هر درخواست انجام می‌شود، نه به شکل بسته‌ای.

همه‌ی تنظیمات این مدل در اختیار شماست: • directions — جهت‌های گسترش. هر ترکیبی از left، right، top و bottom. پیش‌فرض چپ و راست است. اگر می‌خواهید عکس عمودی افقی شود فقط left و right را بدهید. • size — اندازه‌ی نهایی، یکی از چهار حالت آماده: مربع ۱۰۲۴×۱۰۲۴، افقی ۱۲۸۰×۷۲۰، عمودی ۷۲۰×۱۲۸۰ یا افقی ۱۰۲۴×۷۶۸. اندازه باید در جهتی که انتخاب کرده‌اید بزرگ‌تر از عکس اصلی باشد وگرنه چیزی اضافه نمی‌شود؛ مثلاً برای افقی کردن یک عکس عمودی، ۱۲۸۰×۷۲۰ را با جهت‌های چپ و راست بگیرید. • steps — تعداد مراحل تولید، بین ۴ تا ۱۲. عدد بالاتر یعنی ناحیه‌ی جدید پرجزئیات‌تر و زمان بیشتر. پیش‌فرض ۸ برای بیشتر عکس‌ها کافی است. • prompt — اختیاری. اگر خالی بگذارید، مدل خودش ادامه‌ی منطقی صحنه را می‌سازد. اگر بنویسید «ادامه‌ی ساحل و آسمان ابری»، ناحیه‌ی جدید را طبق همان می‌سازد.

فیلدنوعلازمپیش‌فرضتوضیح
image file
image
بله تصویر ورودی که باید کادرش باز شود.
directions multiselect left, right جهت‌هایی که تصویر در آن‌ها گسترش پیدا می‌کند.
مقادیر مجاز: left · right · top · bottom
size select 1024x1024 اندازه‌ی نهایی تصویر بعد از گسترش.
مقادیر مجاز: 1024x1024 · 1280x720 · 720x1280 · 1024x768
steps int 8
4 تا 12
تعداد مراحل تولید؛ بیشتر یعنی دقیق‌تر و کندتر
prompt string توضیح اختیاری برای ناحیه‌ی جدید. خالی بگذارید تا خودکار تصمیم بگیرد.
موتور: Diffusers Image Outpaint
curl https://api.appalpha.ir/v1/generations \
  -H "Authorization: Bearer $ALPHA_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model": "image-expand", "image": "https://example.com/photo.jpg", "directions": ["left", "right"], "size": "1024x1024", "prompt": "ادامه‌ی ساحل و آسمان ابری"}'
ساخت ویدیو — تصویر و متن به ویدیو
ویدیو Wan 2.2 (۱۴B) video-wan22 5000 تومان هر ویدیو

یک تصویر ثابت را به کلیپ متحرک تبدیل می‌کند، با حرکت دوربین و حرکت طبیعی سوژه. دستور شما پیش از ساخت، خودکار به یک دستور سینمایی حرفه‌ای بازنویسی می‌شود.

این مدل دو مرحله دارد و هر دو در همین یک درخواست انجام می‌شود: ۱) ساخت دستور سینمایی — متن ساده‌ی شما (مثلاً «دوربین جلو بره») همراه با خودِ تصویر به یک مدل زبانی داده می‌شود که تصویر را می‌بیند و یک دستور کامل سینمایی می‌نویسد: حرکت دوربین، لنز، نورپردازی، ریتم و جزئیات حرکت سوژه. ۲) ساخت ویدیو — دستور بازنویسی‌شده به Wan 2.2 داده می‌شود. اگر خودتان دستور انگلیسی دقیقی دارید، cinematic را false بگذارید تا متن شما دست‌نخورده استفاده شود. دستور نهایی همیشه در خروجی زیر کلید cinematic_prompt برگردانده می‌شود.

فیلدنوعلازمپیش‌فرضتوضیح
image file
image
بله تصویر شروع ویدیو. کیفیت این عکس مستقیماً روی کیفیت ویدیو اثر دارد.
prompt string توضیح حرکت دلخواه؛ فارسی کافی است. مثلاً «دوربین آرام به سوژه نزدیک می‌شود».
cinematic bool true بازنویسی خودکار دستور به سبک سینمایی
موتور: Wan 2.2 i2v 14B
curl https://api.appalpha.ir/v1/generations \
  -H "Authorization: Bearer $ALPHA_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model": "video-wan22", "image": "https://example.com/photo.jpg", "prompt": "دوربین آرام به سوژه نزدیک می‌شود"}'
LTX-2.3 با صدای فارسی video-ltx-voice 8000 تومان هر ویدیو

ویدیوی باکیفیت که صدا هم تولید می‌کند. دیالوگ فارسی را داخل گیومه بنویسید تا شخصیت همان جمله را به فارسی بگوید.

LTX-2.3 برخلاف بیشتر مدل‌های ویدیو، صدا را هم‌زمان با تصویر می‌سازد. در این نسخه، متن شما دقیقاً همان‌طور که نوشته‌اید و بدون هیچ ترجمه یا دستکاری به مدل می‌رسد؛ به همین دلیل جمله‌های فارسی سالم می‌مانند و شخصیت آن‌ها را با تلفظ فارسی ادا می‌کند. روش نوشتن: صحنه را توصیف کنید و دیالوگ را داخل گیومه بگذارید. مثال: مرد میانسال پشت میز چوبی نشسته، نور پنجره از سمت راست، می‌گوید: «سلام، خوش آمدید». اگر تصویر شروع بدهید، ویدیو از همان تصویر ساخته می‌شود؛ اگر ندهید، کاملاً از متن.

فیلدنوعلازمپیش‌فرضتوضیح
prompt string بله توضیح صحنه به‌همراه دیالوگ فارسی داخل گیومه.
image file
image
تصویر شروع (اختیاری). بدون آن، ویدیو از روی متن ساخته می‌شود.
duration int 8
1 تا 18
مدت ویدیو به ثانیه
width int 1280
512 تا 1920
عرض ویدیو به پیکسل
height int 720
512 تا 1920
ارتفاع ویدیو به پیکسل
موتور: LTX-2.3
curl https://api.appalpha.ir/v1/generations \
  -H "Authorization: Bearer $ALPHA_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model": "video-ltx-voice", "prompt": "مرد میانسال پشت میز چوبی نشسته، می‌گوید: «سلام، خوش آمدید»"}'
LTX-2.3 بهینه‌شده برای فارسی video-ltx-fa 8000 تومان هر ویدیو

همان موتور LTX-2.3، اما توضیح صحنه پیش از ساخت به انگلیسی سینمایی بازنویسی می‌شود و فقط دیالوگ‌های داخل گیومه فارسی باقی می‌مانند.

تفاوت این نسخه با نسخه‌ی «صدای فارسی» فقط در پردازش متن است، نه در موتور: • نسخه‌ی صدای فارسی متن را دست‌نخورده می‌فرستد. اگر انگلیسی سینمایی بلدید بهتر است. • این نسخه توضیح صحنه‌ی فارسی شما را به انگلیسی برمی‌گرداند و بهینه‌ساز داخلی مدل را هم روشن می‌کند، ولی هر چیزی که داخل گیومه نوشته‌اید را دست نمی‌زند. یعنی صحنه دقیق‌تر ساخته می‌شود و دیالوگ همچنان فارسی گفته می‌شود. اگر کلاً فارسی می‌نویسید و نمی‌خواهید درگیر جزئیات انگلیسی شوید، همین نسخه را انتخاب کنید.

فیلدنوعلازمپیش‌فرضتوضیح
prompt string بله توضیح صحنه به فارسی. دیالوگ‌ها را داخل گیومه بگذارید تا فارسی بمانند.
image file
image
تصویر شروع (اختیاری).
duration int 8
1 تا 18
مدت ویدیو به ثانیه
width int 1280
512 تا 1920
عرض ویدیو به پیکسل
height int 720
512 تا 1920
ارتفاع ویدیو به پیکسل
موتور: LTX-2.3
curl https://api.appalpha.ir/v1/generations \
  -H "Authorization: Bearer $ALPHA_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model": "video-ltx-fa", "prompt": "زن جوانی در کافه‌ای شلوغ لبخند می‌زند و می‌گوید: «قهوه‌ات آماده‌ست»"}'
صدا — تغییر، تقویت و جداسازی صدا
تغییر صدا با مدل آلفا alpha-change-voice 1000 تومان برای هر 2 خروجی

نمونه‌ی صدای خودتان و نمونه‌ی صدای مدل را می‌دهید؛ صدای شما با حفظ همان جمله‌ها و لحن، به صدای آن مدل تبدیل می‌شود.

قیمت‌گذاری بسته‌ای. هر خروجی 500 تومان حساب می‌شود؛ یعنی 2 خروجی روی هم 1000 تومان. کسر اعتبار در همان لحظه و به ازای هر درخواست انجام می‌شود، نه به شکل بسته‌ای.

این یک مدل توسعه‌داده‌شده توسط تیم آلفاست؛ یک مدل فوق‌العاده پیشرفته که بدون نیاز به سیستم‌های قدیمی RVC، فقط با یک نمونه صدا هر صدایی را با کیفیت بالا به همان صدا تبدیل می‌کند. در روش قدیمی RVC برای هر صدای مقصد باید یک مدل جداگانه آموزش می‌دادید: ساعت‌ها پردازش، ده‌ها دقیقه دیتای صوتی، و یک فایل مدل چندصد مگابایتی که باید جایی نگه داشته می‌شد. اینجا هیچ‌کدام لازم نیست. یک فایل صوتی کوتاه از صدای مقصد کافی است و همان لحظه تبدیل انجام می‌شود. از این مدل می‌توانید برای وب‌سایت‌های تغییر صدا استفاده کنید و هر چقدر مدل که خواستید با یک نمونه صدا بسازید، یا ساخت مدل را کلاً سمت کاربران خودتان بگذارید: کاربر شما فایل صدای دلخواهش را آپلود می‌کند و بدون هیچ مرحله‌ی آموزشی، بلافاصله صاحب یک «مدل صدا» می‌شود. دو ورودی لازم است: • source_audio — فایلی که محتوای گفتار را دارد؛ همان جمله‌هایی که باید شنیده شود. • reference_audio — نمونه‌ی صدای مقصد؛ فقط برای اینکه مدل بفهمد خروجی باید چه جنس صدایی داشته باشد. حدود ده ثانیه‌ی تمیز و بدون نویز بهترین نتیجه را می‌دهد.

فیلدنوعلازمپیش‌فرضتوضیح
source_audio file
audio
بله فایل صدای اصلی؛ همان جمله‌هایی که باید شنیده شود.
reference_audio file
audio
بله نمونه‌ی صدای مدل مقصد؛ حدود ده ثانیه‌ی تمیز کافی است.
موتور: Alpha Change Voice
curl https://api.appalpha.ir/v1/generations \
  -H "Authorization: Bearer $ALPHA_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model": "alpha-change-voice", "source_audio": "https://example.com/voice.mp3", "reference_audio": "https://example.com/voice.mp3"}'
تقویت صدا voice-enhance 1000 تومان برای هر 2 خروجی

نویز پس‌زمینه و پژواک را حذف می‌کند و وضوح گفتار را بالا می‌برد. برای ضبط با موبایل، جلسه‌ی آنلاین و پادکست خانگی.

قیمت‌گذاری بسته‌ای. هر خروجی 500 تومان حساب می‌شود؛ یعنی 2 خروجی روی هم 1000 تومان. کسر اعتبار در همان لحظه و به ازای هر درخواست انجام می‌شود، نه به شکل بسته‌ای.

فایل‌های بلندتر از یک دقیقه خودکار از روی نقاط سکوت برش می‌خورند، تکه‌تکه پردازش می‌شوند و دوباره به هم می‌چسبند؛ پس لازم نیست خودتان فایل را تکه کنید. گزینه‌ی denoise را روشن بگذارید مگر اینکه فقط می‌خواهید وضوح بالا برود و نویز محیط عمداً حفظ شود.

فیلدنوعلازمپیش‌فرضتوضیح
audio file
audio
بله فایل صوتی ورودی با هر فرمتی.
denoise bool true حذف نویز پیش از تقویت
موتور: Resemble Enhance
curl https://api.appalpha.ir/v1/generations \
  -H "Authorization: Bearer $ALPHA_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model": "voice-enhance", "audio": "https://example.com/voice.mp3"}'
جداسازی صدای خواننده از موزیک vocal-separate 1000 تومان هر جداسازی

آهنگ را می‌گیرد و یا فقط صدای خواننده را برمی‌گرداند یا فقط موسیقی بی‌کلام را. برای کارائوکه، ریمیکس، کاور خوانی و نمونه‌برداری.

خروجی این مدل با فیلد stem مشخص می‌شود و هر بار فقط یکی از دو حالت را می‌دهد: • برای گرفتن ووکال (صدای خواننده): مقدار stem را vocal بگذارید. خروجی فقط صدای خواننده است، بدون ساز و بدون بیت. اگر می‌خواهید روی یک بیت دیگر بگذاریدش یا متن آهنگ را پیاده کنید، همین حالت را بخواهید. • برای گرفتن پس‌زمینه (موسیقی بی‌کلام): مقدار stem را background بگذارید. خروجی همان آهنگ بدون صدای خواننده است؛ یعنی نسخه‌ی کارائوکه. برای کاور خواندن یا استفاده به‌عنوان موسیقی متن همین را بخواهید. اگر هر دو را لازم دارید باید دو درخواست جدا بفرستید و هزینه‌ی هر کدام جداگانه حساب می‌شود. فیلد format فرمت فایل خروجی را تعیین می‌کند: WAV کیفیت کامل و بدون افت، MP3 حجم کمتر، FLAC فشرده‌ی بدون افت. برای پردازش‌های بعدی WAV را انتخاب کنید. بهترین نتیجه از فایل اصلی و باکیفیت آهنگ به دست می‌آید؛ فایلی که خودش قبلاً چند بار فشرده شده، خروجی مبهم‌تری می‌دهد.

فیلدنوعلازمپیش‌فرضتوضیح
audio file
audio
بله فایل آهنگ ورودی.
stem select vocal کدام بخش برگردانده شود.
مقادیر مجاز: vocal · background
format select WAV فرمت فایل خروجی.
مقادیر مجاز: WAV · MP3 · FLAC
dereverb bool false حذف پژواک و اکوی سالن پیش از جداسازی
موتور: Audio Separator
curl https://api.appalpha.ir/v1/generations \
  -H "Authorization: Bearer $ALPHA_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model": "vocal-separate", "audio": "https://example.com/voice.mp3", "stem": "vocal", "format": "WAV"}'
موسیقی — آهنگ‌سازی کامل
ساخت آهنگ music-create 2000 تومان هر آهنگ

از روی توضیح سبک و متن ترانه، یک قطعه‌ی کامل با خواننده یا بی‌کلام می‌سازد. خواندن فارسی پشتیبانی می‌شود.

سبک را در prompt توصیف کنید (ساز، تمپو، حال‌وهوا، کیفیت ضبط) و متن ترانه را در lyrics بگذارید. توضیح سبک خودکار به انگلیسی ترجمه می‌شود، اما متن ترانه دقیقاً همان چیزی می‌ماند که نوشته‌اید تا خواننده ترجمه‌ی ترانه را نخواند. برای آهنگ فارسی، language را روی fa بگذارید. برای قطعه‌ی بی‌کلام، instrumental را true کنید؛ در این حالت lyrics نادیده گرفته می‌شود. فیلدهای bpm، key و time_signature اختیاری‌اند؛ اگر خالی بگذارید مدل خودش متناسب با سبک تصمیم می‌گیرد.

فیلدنوعلازمپیش‌فرضتوضیح
prompt string بله توضیح سبک و حال‌وهوا؛ مثلاً «پاپ ایرانی، گیتار آکوستیک، تمپوی آرام».
lyrics string متن ترانه. برای قطعه‌ی بی‌کلام خالی بگذارید.
language select fa زبان خواندن.
مقادیر مجاز: fa · en · ar · tr
instrumental bool false بی‌کلام؛ بدون خواننده
duration int 120
15 تا 240
مدت قطعه به ثانیه
steps int 27
10 تا 60
تعداد مراحل تولید؛ بیشتر یعنی باکیفیت‌تر و کندتر
format select mp3 فرمت فایل خروجی.
مقادیر مجاز: mp3 · wav
موتور: ACE-Step v1.5
curl https://api.appalpha.ir/v1/generations \
  -H "Authorization: Bearer $ALPHA_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model": "music-create", "prompt": "پاپ ایرانی، گیتار آکوستیک، تمپوی آرام و حال‌وهوای دلنشین", "lyrics": "شب که می‌شود ستاره‌ها\nراه خانه را نشان می‌دهند", "language": "fa", "format": "mp3"}'

نحوه‌ی محاسبه

قیمت‌گذاری بر پایه‌ی تعداد خروجی است، نه توکن. یک تصویر یعنی یک بار قیمت همان مدل؛ طول پرامپت هیچ تأثیری روی مبلغ ندارد. مبلغ در همان لحظه‌ی ثبت درخواست از کیف پول کم می‌شود و در پاسخ با نام cost_toman برمی‌گردد.

بعضی مدل‌ها بسته‌ای معرفی شده‌اند (مثلاً «هر دو تصویر ۱٬۰۰۰ تومان»). این فقط شکل نمایش است؛ در عمل هر درخواست جداگانه و به قیمت یک خروجی حساب می‌شود و لازم نیست حتماً بسته را کامل کنید.

نرخ مرجع تبدیل برای مقایسه با سرویس‌های خارجی: هر دلار 190000 تومان. قیمت‌های آلفا عمداً پایین‌تر از پایین‌ترین تعرفه‌ی موجود در بازار تنظیم شده است.


کدهای خطا

خطاها همیشه با همین ساختار برمی‌گردند:

json
{ "error": { "message": "اعتبار کافی نیست…", "code": "insufficient_credit" } }
کدمعنیکار بعدی
400یکی از فیلدهای لازم نیامده یا مقدارش پذیرفته نشده.پیام خطا نام دقیق فیلد را می‌گوید.
401کلید نیامده، نامعتبر است یا لغو شده.هدر Authorization و وضعیت کلید را بررسی کنید.
402موجودی کیف پول کمتر از هزینه‌ی درخواست است.اعتبار شارژ کنید.
404مدل یا شناسه‌ی درخواست پیدا نشد.شناسه‌ی مدل را از /v1/models بگیرید.
413حجم فایل ورودی بیش از حد مجاز است.فایل را زیر ۴۰ مگابایت فشرده کنید.
502 / 503سرور موقتاً در دسترس نیست.با فاصله‌ی فزاینده دوباره تلاش کنید. مبلغی کسر نشده.

پرسش‌ها

پشتیبانی از کجاست؟

پشتیبانی فقط از طریق تلگرام انجام می‌شود: @App_alpha_support. شارژ اعتبار، رزرو ظرفیت و گزارش مشکل همه از همین کانال انجام می‌شود.

چند درخواست هم‌زمان می‌توانم بفرستم؟

سقف سختی تعیین نشده، اما ارسال ده‌ها درخواست موازی صف را کند می‌کند. برای بار سنگین، یک صف داخلی بگذارید و پیش از شروع در تلگرام هماهنگ کنید.

خروجی تا چه زمانی در دسترس است؟

آدرس خروجی برای دانلود فوری در نظر گرفته شده. بلافاصله بعد از آماده شدن، فایل را روی فضای خودتان کپی کنید.

می‌شود درخواست را لغو کرد؟

فعلاً نه. وقتی درخواست وارد صف شد تا پایان اجرا می‌شود. اگر شکست بخورد، هزینه خودکار برمی‌گردد.

پرامپت فارسی چطور پردازش می‌شود؟

در بیشتر مدل‌ها پیش از رسیدن به مدل به انگلیسی ترجمه می‌شود. دو استثنا وجود دارد: در video-ltx-voice متن اصلاً دست‌نخورده می‌رود تا دیالوگ فارسی سالم بماند، و در video-ltx-fa فقط توضیح صحنه ترجمه می‌شود و هرچه داخل گیومه باشد فارسی می‌ماند. در music-create هم توضیح سبک ترجمه می‌شود اما متن ترانه هرگز.