这是关于如何使用MCP进行交互式vLLM性能测试的概念验证。
我们对性能测试并不陌生,请参阅我们的博客:
这只是探索MCP可能性的一部分。
{
"mcpServers": {
"mcp-vllm": {
"command": "uv",
"args": [
"run",
"/Path/TO/mcp-vllm-benchmarking-tool/server.py"
]
}
}
}
然后您可以像这样提示:
为此端点执行vllm性能测试:http://10.0.101.39:8888
测试以下模型:deepseek-ai/DeepSeek-R1-Distill-Llama-8B
运行三次基准测试,每次使用32个提示数,然后比较结果,但忽略第一次迭代,因为那只是预热。