AI万址

标签:LLM评估

包含标签「LLM评估」的全部资源

20 个结果

LLM自动化评估服务

Scorable MCP Server是一个将Scorable评估器作为工具暴露给AI助手和代理的模型上下文协议服务器,用于评估响应质量。

混合部署
自动化控制
LLM评估
02026-07-28 00:00:00

LLM评估框架

一个使用新颖MCP技术的全面LLM评估框架。

本地部署
LLM评估
MCP技术
02025-12-19 00:00:00

LLM评估框架

一个使用新颖MCP技术对大型语言模型进行全面评估的框架。

本地部署
LLM评估
MCP技术
02025-12-31 00:00:00

LLM评估框架

一个使用新颖MCP技术的全面大型语言模型评估框架。

本地部署
LLM评估
MCP技术
02026-01-22 00:00:00

LLM性能基准测试工具

本地和云端LLM在真实MCP工具调用场景下的性能基准测试工具,包含21个本地LLM的单次调用与代理循环测试。

本地部署
LLM评估
性能测试
02026-02-27 00:00:00

LLM评估框架

一个使用MCP技术的全面LLM评估框架。

本地部署
LLM评估
MCP技术
02026-03-03 00:00:00

LLM评估工具

一个可重用的GitHub Action,用于对任何MCP服务器运行LLM评估,通过定义测试用例并自动评分和验证工具调用。

本地部署
自动化测试
LLM评估
02026-03-12 00:00:00

LLM评估框架

一个使用新颖MCP技术对大型语言模型进行全面评估的框架。

本地部署
LLM评估
MCP技术
02025-12-29 00:00:00

LLM评估框架

一个使用新型MCP技术对大型语言模型进行全面评估的框架。

本地部署
LLM评估
MCP技术
02026-03-03 00:00:00

LLM评估框架

一个使用新颖MCP技术的全面LLM评估框架。

本地部署
LLM评估
MCP技术
02025-12-31 00:00:00

AI可观测性平台

Phoenix是一个开源的AI可观测性平台,专为实验、评估和故障排除设计,支持多种LLM框架和提供商。

本地部署
AI可观测性
LLM评估
02026-08-16 00:00:00

LLM评估服务器

Atla MCP Server是一个标准化的LLM评估接口服务器,提供Selene 1模型进行单次和批量评估,适用于AI助手开发和内容质量评估。

本地部署
AI开发工具
LLM评估
02025-04-16 00:00:00

LLM函数调用性能评估框架

基于OpenRouter API的LLM函数调用性能评估框架,用于精确测量大型语言模型的函数调用能力。

本地部署
LLM评估
函数调用
02026-03-18 00:00:00

功能调用评估工具

通过OpenRouter API评估多个LLM模型的功能调用能力并自动生成专业Excel报告的项目。

本地部署
LLM评估
功能调用
02026-03-18 00:00:00

LLM二次评估服务

该服务通过调用第二个LLM对原始LLM的响应进行二次评估,为用户提供改进建议和多角度分析。

本地部署
多模型协作
LLM评估
02025-11-20 00:00:00

LLM评估服务

Atla MCP Server是一个提供标准化接口的服务,用于通过Atla API对LLM响应进行多维度评估,适用于模型性能测试和反馈分析。

本地部署
LLM评估
模型测试
02025-07-21 00:00:00

AI代理开发与评估框架

MCP-Universe 是一个用于开发、测试和评估AI代理的综合框架,支持与外部MCP服务器的无缝集成和复杂的代理编排工作流,适用于真实世界场景中的多步骤任务评估。

本地部署
AI代理
LLM评估
02025-11-25 00:00:00

AI评估平台

MCP评估服务器是一个全面的AI评估平台,提供63种专业工具,涵盖14个类别,用于使用LLM-as-a-judge技术和基于规则的指标进行AI系统评估。

本地部署
LLM评估
AI评估
02026-02-19 00:00:00

LLM工具再生评估框架

MCPFlow-Evaluation是一个用于评估大型语言模型在再生MCP工具并在现有工作流中验证其功能的综合框架。

本地部署
LLM评估
工具再生
02026-04-10 00:00:00

LLM工具调用评估框架

Toolvaluator是一个用于测试和评估语言模型工具调用能力的框架,帮助开发者优化工具模式和提高模型性能。

本地部署
工具调用
LLM评估
02025-11-29 00:00:00