| 框架 | 定位 | 内存占用 | 易用性 | 适用场景 |
|---|---|---|---|---|
| llama.cpp | 极致轻量,CPU可跑 | 7B-Q4仅4GB | 需编译 | 嵌入式/低资源 |
| Ollama | llama.cpp套壳,傻瓜式 | 自动优化 | 最高 | 快速原型/多模型切换 |
| vLLM | 生产级高并发 | 高(需GPU) | 中等 | 云端GPU集群 |
| LocalAI | 兼容OpenAI API | 中等 | 中等 | API兼容场景 |
Ollama的Docker式体验:ollama run qwen2.5 一键启动,1700+模型库,自动量化优化。llama.cpp的AVX2/NEON指令集加速,CPU推理速度提升3-5倍。4-bit量化是内存与质量的最优平衡点。
当前已用llama-server(llama.cpp系)运行0.5B模型。优化方向:①借鉴Ollama的模型管理,支持多模型一键切换(0.5B日常/1.5B复杂任务);②算力注入prompt必须注入系统状态(服务健康/真值数/内存/最新元法则),解决当前小模型"无法获取系统状态"的断点;③Q4_K_M量化作为标准配置。
| 框架 | 范式 | 优势 | 劣势 | 内存对比 |
|---|---|---|---|---|
| LangGraph | 状态机图 | 确定性强/可观测 | 学习曲线高 | 比AutoGen少30% |
| CrewAI | 角色团队 | 10分钟上手/代码少 | 复杂分支弱 | 轻量 |
| AutoGen | 对话驱动 | 协作自然/人机协同 | 流程不可控 | 中等 |
| Dify/Coze | 可视化低代码 | 产品经理可用 | 灵活度低 | 较重 |
LangGraph的节点+边+全局状态模式,复杂工作流性能最优,可观测性最好。CrewAI的角色+任务+团队设计,10分钟上手,最贴近人类协作。CrewAI v1.10已原生支持MCP和A2A协议。实验结论:新团队应优先LangGraph+LangChain生态。
已有模块化智能体编排引擎V1.0+A2A通讯协议。优化方向:①借鉴LangGraph的状态机确定性,给DAG运行时增加全局状态追踪;②借鉴CrewAI的角色驱动简洁性,每个智能体有明确角色定义;③多智能体辩论决策(乐观/保守/中立)用LangGraph状态机实现,比自由对话更可控。
| 架构 | 核心思想 | 优势 | 资源需求 |
|---|---|---|---|
| 传统向量RAG | 扁平向量相似度 | 简单/局部片段强 | 极低 |
| Graph RAG(微软) | 知识图谱+全局摘要 | 全局性问题强 | 中等(需图数据库) |
| LightRAG(港大) | 图谱+向量双层次 | 轻量/增量更新 | 极低(NanoVectorDB+NetworkX) |
| RAGdb | 零依赖SQLite容器 | 嵌入式/无GPU | 极低 |
LightRAG的双层次检索:低层向量检索+高层知识图谱发现,增量更新算法确保新数据及时融入。默认存储NanoVectorDB+NetworkX,无需外部数据库。RAGdb用单个SQLite容器实现多模态RAG,查询时无需GPU。文档切片不能用固定字符数,语义切片是召回率的关键。
已有8014向量库+8070知识图谱+8085 RAG+9120真值库(四组件独立未串联)。优化方向:①借鉴LightRAG双层次架构,把8014向量+8070图谱串联,实现"向量检索+图谱遍历"双路召回;②用NetworkX做轻量图谱存储,不引入Neo4j等重依赖;③语义切片替代固定字符切片;④目标:内核真正"懂自己",自然语言问答基于私有知识库。
| 技术 | 核心能力 | 性能指标 | 代表案例 |
|---|---|---|---|
| WebAssembly | 编译一次到处运行 | 比JS快1.5-20倍 | Figma/Photoshop |
| WASM边缘函数 | 微秒级冷启动 | 1-5ms冷启动 | Cloudflare Workers |
| WASI | 系统级API | 64MB RAM可跑 | WasmEdge |
| PWA | 离线可用类原生 | 安装到桌面 | 各类Web应用 |
Cloudflare Workers已部署Llama-3-8b到330个全球节点,冷启动<5ms,推理速度2-4倍提升。WASM二进制<1MB,无需guest OS,64MB RAM设备可运行。2026年WASM已成为边缘计算的主导运行时,Akamai收购Fermyon标志着企业级认可。"边缘优先开发"成为新架构典范:计算发生在离用户最近的地方。
已有单文件HTML自包含体系(黑金高端风格)。优化方向:①"网页即智能体身体"理念与WASM边缘计算理念高度契合——每个网页就是一个可独立运行的智能体实体;②计算密集型任务(如图表渲染、数据处理)可用WASM在浏览器端执行,减轻服务器压力;③PWA化核心页面,支持离线访问和桌面安装;④单文件HTML已是最轻量部署,比容器更轻。
| 阶段 | 时间 | 模式 | 代表 | 特点 |
|---|---|---|---|---|
| API卖水 | 2023-2024 | 按Token计费 | OpenAI API | 门槛低利润薄 |
| 订阅制 | 2025 | 免费+增值订阅 | 豆包/ChatGPT | 用户筛选机制 |
| 按效果付费 | 2026 | RaaS/价值分成 | Sierra/云蝠 | 预算转利润中心 |
豆包三档付费(68/200/500元)+基础永久免费,是"免费+陡峭增值"的用户筛选机制。阿里两种生意:标准化SaaS订阅(中小团队)+私有化部署定制(大型政企)。美图AI算力点模式:订阅外按量购买,算力点消耗增长59%。AI应用留存率比传统SaaS低30-50%,高频使用习惯是关键。
已有"免费作品展示引流"策略。三阶段路径:①阶段1(现在):免费作品展示+能力体验,验证内容吸引力,积累案例;②阶段2(1-3月):标准化SaaS订阅(短剧生产/政务AI/教育平台按席位),AI算力点按量购买;③阶段3(3-6月):大型政企私有化部署+定制化服务,按效果付费(RaaS)。零成本约束:所有功能先免费跑通,付费需人工审核确认。
✅ 可立即部署 多模型切换、状态机编排、双层次RAG、语义切片——均为Python轻量框架,3.6G内存可运行
⚠️ 需优化后部署 算力注入质量提升——需先优化prompt注入系统状态,否则小模型空转
⚠️ 第二阶段 WASM边缘计算、PWA化——理念已对齐,技术实施需专项开发
⚠️ 第三阶段 商业化付费——零成本约束下,先免费跑通再考虑付费