标签:LLM评估
包含标签「LLM评估」的全部资源
共 20 个结果
LLM自动化评估服务
Scorable MCP Server是一个将Scorable评估器作为工具暴露给AI助手和代理的模型上下文协议服务器,用于评估响应质量。
LLM评估框架
一个使用新颖MCP技术的全面LLM评估框架。
LLM评估框架
一个使用新颖MCP技术对大型语言模型进行全面评估的框架。
LLM评估框架
一个使用新颖MCP技术的全面大型语言模型评估框架。
LLM性能基准测试工具
本地和云端LLM在真实MCP工具调用场景下的性能基准测试工具,包含21个本地LLM的单次调用与代理循环测试。
LLM评估框架
一个使用MCP技术的全面LLM评估框架。
LLM评估工具
一个可重用的GitHub Action,用于对任何MCP服务器运行LLM评估,通过定义测试用例并自动评分和验证工具调用。
LLM评估框架
一个使用新颖MCP技术对大型语言模型进行全面评估的框架。
LLM评估框架
一个使用新型MCP技术对大型语言模型进行全面评估的框架。
LLM评估框架
一个使用新颖MCP技术的全面LLM评估框架。
AI可观测性平台
Phoenix是一个开源的AI可观测性平台,专为实验、评估和故障排除设计,支持多种LLM框架和提供商。
LLM评估服务器
Atla MCP Server是一个标准化的LLM评估接口服务器,提供Selene 1模型进行单次和批量评估,适用于AI助手开发和内容质量评估。
LLM函数调用性能评估框架
基于OpenRouter API的LLM函数调用性能评估框架,用于精确测量大型语言模型的函数调用能力。
功能调用评估工具
通过OpenRouter API评估多个LLM模型的功能调用能力并自动生成专业Excel报告的项目。
LLM二次评估服务
该服务通过调用第二个LLM对原始LLM的响应进行二次评估,为用户提供改进建议和多角度分析。
LLM评估服务
Atla MCP Server是一个提供标准化接口的服务,用于通过Atla API对LLM响应进行多维度评估,适用于模型性能测试和反馈分析。
AI代理开发与评估框架
MCP-Universe 是一个用于开发、测试和评估AI代理的综合框架,支持与外部MCP服务器的无缝集成和复杂的代理编排工作流,适用于真实世界场景中的多步骤任务评估。
AI评估平台
MCP评估服务器是一个全面的AI评估平台,提供63种专业工具,涵盖14个类别,用于使用LLM-as-a-judge技术和基于规则的指标进行AI系统评估。
LLM工具再生评估框架
MCPFlow-Evaluation是一个用于评估大型语言模型在再生MCP工具并在现有工作流中验证其功能的综合框架。
LLM工具调用评估框架
Toolvaluator是一个用于测试和评估语言模型工具调用能力的框架,帮助开发者优化工具模式和提高模型性能。
