结论:完全可行,且非常必要。 当前服务器3.6G内存无法同时加载所有模型,秒塔的"感知底层常驻+算子中层按需加载+用完即卸"正是最优架构。 推广后预计内存峰值降低40-60%,推理延迟降低30%,系统稳定性显著提升。
| 指标 | 当前架构 | 秒塔架构 | 提升 |
|---|---|---|---|
| 内存峰值 | 持续上涨(模型常驻) | 稳态(用完即卸) | ↓40-60% |
| 推理延迟 | 固定(全量加载) | 自适应(fast模式0.4s) | ↓30-50% |
| 并发能力 | 受内存限制 | 按需加载,支持更多并发 | ↑2-3倍 |
| 熔断能力 | 仅MR-007全局熔断 | 每层独立熔断+降级 | 精细化 |
| 资源弹性 | 固定配置 | 根据水位自动切换模式 | 自适应 |
| 新功能开发 | 从零搭建 | 复用秒塔四层模板 | ↑50%效率 |
🎯 推荐:先启动阶段一(火斗云智智能体秒塔重构)
原因:① 用户直接感知,体验提升最明显 ② 为后续短剧/政务复用提供基础层 ③ 改动范围可控,风险低
重构内容:将当前 ai_proxy:8021 升级为秒塔架构,增加意图识别层、算子按需加载、三维稳态裁决层,保留现有8个免费API路由能力。