evaluating-llms-harness
用 lm-eval-harness 跑 LLM 基准测试:MMLU、GSM8K 等。适合评估模型能力、对比模型性能、发布模型前跑分。
技能介绍
用 lm-eval-harness 跑 LLM 基准测试:MMLU、GSM8K 等。适合评估模型能力、对比模型性能、发布模型前跑分。
适用对象
适合需要mlops能力、并希望先了解条目用途再决定是否安装的技能用户。
资料中明确的能力与使用场景
- 用 lm-eval-harness 跑 LLM 基准测试:MMLU、GSM8K 等
- 适合评估模型能力、对比模型性能、发布模型前跑分
- lm-eval-harness: benchmark LLMs (MMLU, GSM8K, etc
详细说明
lm-eval-harness: benchmark LLMs (MMLU, GSM8K, etc.).
分类与标签
分类:mlops · mlops
相关入口
限制与注意事项
当前条目资料未提供独立的版本兼容性、参数表或完整测试报告;未列出的系统、依赖、权限与功能边界,请以官方入口的 README 和实际环境为准。