标签:基准测试
包含标签「基准测试」的全部资源
共 22 个结果
MCP服务器性能基准测试工具
该工具用于在Power BI语义模型上对'好'与'坏'的MCP服务器进行基准测试,测量令牌使用、工具调用和每次运行的成本。
MCP服务器基准测试工具
一个基于网页的基准测试工具,用于比较两个MCP(Model Context Protocol)服务器的性能,支持响应延迟测量、代理状态跟踪和响应质量评分。
游戏开发基准测试套件
GameDevBench 是一个用于评估LLM代理在游戏开发任务中表现的基准测试套件,包含132个Godot游戏引擎开发任务。
提交整理基准测试工具
该项目用于测试编码代理在将未暂存的更改整理为范围明确、原子性提交方面的能力,并衡量其原子性准确性、令牌和时间效率。
上下文共享基准测试工具
一个完整的基准测试和分析套件,用于在MS MARCO数据集上评估五种上下文共享策略的性能、开销和一致性。
MCP服务器基准测试工具
一个基于Rust的基准测试工具,用于测量MCP服务器在LLM辅助开发中的有效性,比较不同MCP服务器对令牌使用、成本和任务完成的影响。
多轮工具使用代理基准测试
TAU2-Bench是一个基于多轮对话和工具使用的代理基准测试工具,用于评估LLM模型在客户服务任务中的表现。
CLI与MCP基准测试工具
比较CLI工具与MCP工具在Claude模型下的执行效率,展示输入令牌节省和工具定义大小的差异。
基准测试运行器
一个通过LLM运行.NET基准测试的MCP服务器,支持返回结果和生成多种格式的报告,适用于性能检查、PR中的性能比较和快速回归测试。
内存系统基准测试工具
用于nexus-agents的内存系统基准测试工具,提供memory_query和memory_stats工具的端到端测试。
基准测试套件
Docker化的基准测试套件,用于验证dietmcp的令牌减少和行为声明。
基准测试代理服务
一个用于运行和管理基准测试的代理服务器,支持自动化测试和性能评估。
MCP服务器基准测试框架
用于评估MCP服务器有效性的基准测试框架,测量MCP工具是否提高AI代理准确性及其令牌成本。
移动测试基准工具
一个用于基准测试MCP移动测试工具的样本应用,包含Android应用和Node.js后端,模拟了使用不同HTTP库的共享乘车服务。
MCP代理命令行工具
一个无头的、支持模型上下文协议(MCP)的命令行界面,用于对Anthropic驱动的代理运行进行基准测试和比较,并管理完整的运行循环。
vLLM基准测试工具
一个用于交互式基准测试vLLM性能的工具,支持多轮测试和结果比较。
代码智能基准测试工具
rag-bench 是一个用于测量代码智能检索系统性能的基准测试工具,支持A/B测试和检索质量评估。
多轮工具调用基准测试工具
MCPMark-lite RFT Example是一个独立的、Docker打包的多轮工具调用基准测试工具,兼容eval-protocol和Fireworks RFT,用于在文件系统上执行真实工具操作并进行确定性验证。
MCP服务器基准测试工具
一个用于评估MCP服务器性能的基准测试工具,能够通过对比实验测量MCP服务器对LLM在软件工程任务中的表现影响。
MCP基准测试工具
一个独立的npx兼容工具,用于对MCP(模型上下文协议)工具进行基准测试,支持并行测试、自定义项目和生成详细报告。
AI模型聊天与基准测试工具
一个用于与AI模型聊天并对其进行基准测试的Python Web应用,支持多种AI提供商和MCP服务器。
AI框架基准测试套件
一个用于测试和比较AI框架(CrewAI、LangGraph、DSPy和Langchain)与MCP服务器集成的综合基准测试套件。
