标签:模型评估
包含标签「模型评估」的全部资源
共 5 个结果
LLM模型协议桥接器
一个与OpenAI兼容的MCP(Model Context Protocol)服务器,用于分析和评估LLM模型的质量。
本地部署
LLM接口
模型评估
02025-12-06 00:00:00
LLM可观测性与评估平台协议服务器
Opik MCP Server是为开源LLM可观测性和评估平台Opik提供的官方协议服务器,支持直接从AI助手读取跟踪数据、记录分数、保存提示版本并进行调查性提问。
本地部署
模型评估
LLM可观测性
02026-08-15 00:00:00
模型评估工具
MCP评估工具是一个专注于时间序列预测模型的论文级评估框架,提供完整的审计跟踪和分析报告。
本地部署
模型评估
时间序列预测
02026-02-20 00:00:00
AI测试协议服务器
AI Testing MCP是一个基于模型上下文协议(MCP)的服务器,提供标准化的AI/ML系统测试方法、评估指标和自动化测试工作流程。
本地部署
AI测试
模型评估
02026-03-25 00:00:00
大语言模型基准测试工具
MetriLLM是一款用于本地大语言模型性能和质量基准测试的工具,支持生成综合评分并分享至公共排行榜。
本地部署
模型评估
LLM基准测试
02026-06-02 00:00:00
