انتخاب سرور، سشن و جلوگیری از شلوغ شدن یک سرور
برای مدلهای چندسروره، انتخاب سرور بهصورت رندوم و ظرفیتمحور انجام میشود؛ اما این انتخاب فقط در شروع سشن جدید انجام میشود. وقتی کلاینت conversation_id بفرستد، همان گفتگو روی سرور انتخابشده قفل میشود تا وسط صحبت کاربر سرور عوض نشود.
درخواست بدون conversation_idStateless است؛ هر درخواست میتواند به یکی از سرورهای سالم همان مدل برود.
درخواست با conversation_idبرای همان گفتگو روی یک سرور قفل میشود. اگر همان سرور پر شد، کاربر باید صبر کند یا حافظه را با سشن جدید منتقل کند.
چت داخلی Portal-AIدر شروع چت جدید سرور انتخاب میشود و تا پایان همان چت ثابت میماند.
{
"model":"gpt-5.2",
"conversation_id":"customer-chat-123",
"messages":[{"role":"user","content":"سلام"}]
}