← 返回技能 & 工具

evaluating-llms-harness

用 lm-eval-harness 跑 LLM 基准测试:MMLU、GSM8K 等。适合评估模型能力、对比模型性能、发布模型前跑分。

AI 技能 · mlops

技能介绍

用 lm-eval-harness 跑 LLM 基准测试:MMLU、GSM8K 等。适合评估模型能力、对比模型性能、发布模型前跑分。

适用对象

适合需要mlops能力、并希望先了解条目用途再决定是否安装的技能用户。

资料中明确的能力与使用场景

  • 用 lm-eval-harness 跑 LLM 基准测试:MMLU、GSM8K 等
  • 适合评估模型能力、对比模型性能、发布模型前跑分
  • lm-eval-harness: benchmark LLMs (MMLU, GSM8K, etc

详细说明

lm-eval-harness: benchmark LLMs (MMLU, GSM8K, etc.).

分类与标签

分类:mlops · mlops

相关入口

查看官方项目或原始入口 ↗

限制与注意事项

当前条目资料未提供独立的版本兼容性、参数表或完整测试报告;未列出的系统、依赖、权限与功能边界,请以官方入口的 README 和实际环境为准。

相关技能与分类