AI万址

Lamini

Lamini是企业级LLM精调平台,通过Memory Tuning技术实现95%+事实准确率,支持Air-Gapped私有化部署。新用户享300美元免费额度。

Lamini
访问官网
基本信息详情
开发公司Lamini(总部位于美国加州 Menlo Park)
上线时间2022年
官网https://lamini.ai/
支持平台云端 SaaS、私有化部署(支持 Kubernetes、Air-Gapped 离线部署)
价格免费额度 300 美元 credits;企业版定制报价
核心定位企业级 LLM 精调与高精度推理平台,主打消除幻觉、95%+ 事实准确率

如果你用 GPT-4 做过企业级 LLM 应用,大概率碰到过这个场景:模型在通用问题上表现不错,但一碰到你的私有数据就开始胡说八道。RAG 能缓解一部分,但复杂查询的准确率往往卡在 50-60%。

Lamini 解决的就是这个问题。它的 Memory Tuning 技术能把事实直接注入模型参数,把准确率推到 95% 以上。不是微调到差不多就行,而是让模型对关键事实做到"照相机级记忆"。这个思路来自他们 2024 年发表在 arXiv 的论文,核心是用 Mixture of Memory Experts(MoME)架构替代传统 Transformer 做知识检索。

公司由 Sharon Zhou 和 Greg Diamos 在 2022 年创立。Sharon 是斯坦福博士,导师是 Andrew Ng;Greg 是前 NVIDIA CUDA 软件架构师。团队声称参与了 LLM scaling laws 等核心研究,指导过后来构建 GPT-3、GPT-4、Claude、Llama 3 的技术负责人。2023 年拿到 2500 万美元 A 轮融资,投资方包括 First Round Capital 和 Amplify Partners。

核心功能

01

Memory Tuning

Lamini 的旗舰产品。你给它 10 条事实和示例就能开始训练,扩展到 10 万条以上也没问题。它把事实存进数百万个 memory experts 里动态检索,训练 loss 对关键事实逼近零。实际效果:某 Fortune 500 客户用它做 Text-to-SQL,准确率达到 94.7%,节省了 100+ 小时工程时间。另一个客户做内容分类,准确率 100%,每年省 1200+ 小时人工。

02

Memory RAG

比 Memory Tuning 更简单,开箱即用。你上传 PDF 或文档,它自动构建 smart embedding 索引,然后通过 embed-time compute 生成更智能的数据表示。官方说准确率从 GPT-4 基础 RAG 的 50% 提升到 90-95%。代码量很少:pip install lamini,几行 Python 就能跑起来。

03

Classifier Agent Toolkit

高吞吐量分类器。支持 2 到 1000+ 个类别,处理速度 40 万 tokens/秒,准确率 99.9%。适合做客服意图路由、代码分流、内容审核。Copy.ai 用它做内容自动分类,部署后说"比 sklearn 的 finetuning 流程快了不知道多少倍"。

适合谁

适合的: 需要在私有数据上构建高精度 LLM 应用的工程团队。你的场景对事实准确率有硬性要求(金融、法律、医疗文档问答),数据不能出内网(Air-Gapped 部署),预算有限想用小模型替代 GPT-4。

不适合的: 只需通用聊天能力的团队,直接用 OpenAI API 更省事。没有 Python 开发能力的非技术用户,Lamini 的 SDK 和 API 设计面向开发者,不是面向终端用户的产品。

同类竞品对比

维度LaminiOpenAI Fine-tuningTogether AIGoogle Vertex AI
数据隐私最强(支持 Air-Gapped)共享基础设施云端 VPCGoogle Cloud VPC
模型控制权完全自有受限中等中等
准确率上限95%+(Memory Tuning)取决于数据质量取决于模型选择取决于模型选择
GPU 支持NVIDIA + AMD仅 NVIDIA主要 NVIDIAGoogle TPU + NVIDIA
定价$300 免费额度起步按 token 计费按 token 计费按 token 计费
适合场景事实精度要求高的企业通用微调开源模型推理Google 生态内企业

FAQ

Q

Lamini 的 Memory Tuning 和普通 fine-tuning 有什么区别?

A

普通 fine-tuning 调整模型所有参数,训练 loss 降不下去,事实性提升有限。Memory Tuning 用 MoME 架构把关键事实存到独立 memory experts 里动态检索,训练 loss 对这些事实逼近零。区别就是:普通微调让模型"大概记住",Memory Tuning 让模型"精确记住"。

Q

需要多少数据才能开始?

A

官方说 10 条事实和示例就能起步。但实际使用中,数据越多效果越好。他们的数据生成器可以从 100 个样本扩到 5 万个训练样本。

Q

支持哪些底层模型?

A

任何开源模型。Llama 3、Mistral、Gemma 等都可以。API 兼容 OpenAI 格式,迁移成本低。

Q

价格贵不贵?

A

新用户有 300 美元免费额度,够你跑几轮 Memory Tuning 和 Memory RAG。企业版是定制报价,官方没有公开具体数字。和一些云厂商的 fine-tuning 服务比,Lamini 的优势在于用更小的模型达到更高精度,推理成本反而更低。

Q

Sharon Zhou 加入 AMD 后 Lamini 怎么办?

A

2025 年 6 月,Sharon Zhou 和部分团队成员加入 AMD 担任 VP of AI。这对 Lamini 的长期方向有不确定性,但平台和文档目前仍在运营。如果你考虑深度集成,建议关注官方博客的最新动态。

Q

可以私有化部署吗?

A

可以。支持 Kubernetes 集群部署和 Air-Gapped 离线模式。这是它和 OpenAI、Together AI 等纯云端服务的核心差异点。

更新动态

客户评论

综合评分:4.6 / 5

"Lamini 的 classifier SDK 很好用。模型调好后测试、部署到生产一气呵成。让我们能非常快速地推进。" -- Chris Lu,CTO

"不像 sklearn 那样需要大量文档和最佳实践。传统 finetuning 要几周反复试错,用 Lamini 我震惊了--2 小时搞定。" -- 某 Fortune 500 工程负责人

参考来源