انتخاب سرور، سشن و جلوگیری از شلوغ شدن یک سرور

برای مدل‌های چندسروره، انتخاب سرور به‌صورت رندوم و ظرفیت‌محور انجام می‌شود؛ اما این انتخاب فقط در شروع سشن جدید انجام می‌شود. وقتی کلاینت conversation_id بفرستد، همان گفتگو روی سرور انتخاب‌شده قفل می‌شود تا وسط صحبت کاربر سرور عوض نشود.

درخواست بدون conversation_idStateless است؛ هر درخواست می‌تواند به یکی از سرورهای سالم همان مدل برود.
درخواست با conversation_idبرای همان گفتگو روی یک سرور قفل می‌شود. اگر همان سرور پر شد، کاربر باید صبر کند یا حافظه را با سشن جدید منتقل کند.
چت داخلی Portal-AIدر شروع چت جدید سرور انتخاب می‌شود و تا پایان همان چت ثابت می‌ماند.
{
  "model":"gpt-5.2",
  "conversation_id":"customer-chat-123",
  "messages":[{"role":"user","content":"سلام"}]
}