الگوی برنده بکاندهای AI-era این است:
کاربر آپلود میکند → رویداد خام به صف میرود → worker با LLM/embedding غنی میکند → رویداد غنی به جستجو، اعلان و آنالیتیکس fan-out میشود.
چرا داخل Request نگذاریم؟
Timeout، هزینه متغیر مدل، و نیاز به retry — هیچکدام مناسب مسیر همزمان HTTP کاربر نیستند.
اجزا
- Topic رویداد خام و رویداد غنیشده
- Worker با concurrency کنترلشده
- ذخیره نتیجه در DB/Vector
- DLQ برای شکست مدل یا پارس
کیفیت
نسخه مدل و نسخه prompt را در متادیتای رویداد ثبت کنید تا بتوانید بازتولید کنید.
این الگو برای فروشگاه (تگ خودکار کالا)، آموزش (خلاصهسازی جلسه) و پشتیبانی (طبقهبندی تیکت) فوقالعاده است.