Benchmark Hub
查找 benchmark,检查执行边界,并打开由 manifest 生成的运行配方。
64 benchmarks目录数据来自仓库 manifest
Benchmark主要指标状态执行方式验证状态Judge
ChronoMagic-Benchchronomagic-bench仓内 official runtime 对生成视频逐 prompt 评分;部分维度可能调用 hosted API
chronomagic_score已有验证证据视频生成官方 runtimeVerified托管 APIEvalCrafterevalcrafter仓内 official runtime 对生成视频逐 prompt 评分evalcrafter_total已有验证证据视频生成官方 runtimeVerified本地 / 无 APIFETVfetv仓内 official runtime 对生成视频逐 prompt 评分fetv_average已有验证证据视频生成官方 runtimeBounded Official Clipscore Verified本地 / 无 APIT2V-CompBencht2v-compbench仓内 official runtime 对生成视频逐 prompt 评分;部分维度可能调用 hosted APIt2v_compbench_average已有验证证据视频生成官方 runtimeBounded Official Generative Numeracy Verified托管 APIVBenchvbench仓内 official runtime 对生成视频逐 prompt 评分overall_quality已有验证证据视频生成官方 runtimeVerified本地 / 无 APIVBench-2.0vbench-2.0仓内 official runtime 对生成视频逐 prompt 评分;部分维度可能调用 hosted APIvbench2_total已有验证证据视频生成官方 runtimeVerified托管 APIVBench++vbench-plus-plus仓内 official runtime 对生成视频逐 prompt 评分;部分维度可能调用 hosted APIvbench_plus_plus_average已有验证证据视频生成官方 runtimeVerified托管 APIVideo-Benchvideo-bench仓内 official runtime 对生成视频逐 prompt 评分;部分维度可能调用 hosted APIvideobench_average已有验证证据视频生成官方 runtimeVerified托管 APIVideoScorevideoscore仓内 official runtime 对生成视频逐 prompt 评分videoscore_average已有验证证据视频生成官方 runtimeVerified本地 / 无 APIWorldBenchworldbench仓内 evaluator 按 task protocol 评估 artifact bundleforeground_miou已有验证证据世界模型In Tree Model Backed EvaluatorBounded Fixture Verified本地 / 无 APIWorldModelBenchworldmodelbench仓内 official runtime 对生成视频逐 prompt 评分world_model_average已有验证证据世界模型官方 runtimeVerified本地 / 无 APIWorldScoreworldscore仓内 official runtime 对生成视频逐 prompt 评分worldscore_average已有验证证据世界模型官方 runtimeVerified本地 / 无 API4DWorldBench4dworldbench仓内 official runtime 对生成视频逐 prompt 评分four_d_worldbench_average已接入世界模型官方 runtime未记录本地 / 无 APIAI2-THORai2thor闭环仿真 rollout,或归一化官方 rollout 结果success_rate已接入具身 AI闭环仿真Integration Ready本地 / 无 APIAIGCBenchaigcbench导入预计算 metric 并归一化为 scorecardaigcbench_average已接入视频生成Artifact 导入In Tree Artifact Import Ready本地 / 无 APICameraBenchcamerabench仓内 official runtime 对生成视频逐 prompt 评分;部分维度可能调用 hosted APIcamerabench_average已接入视频生成未记录待验证托管 APIDEVIL Dynamicsdevil-dynamics仓内 official runtime 对生成视频逐 prompt 评分;部分维度可能调用 hosted APIdevil_dynamics_average已接入视频生成官方 runtime待验证托管 APIEWMBenchewmbench仓内 official runtime 对生成视频逐 prompt 评分ewmbench_average已接入世界模型官方 runtime待验证本地 / 无 APIGenAI-Benchgenai-bench仓内 official runtime 对生成视频逐 prompt 评分genai_bench_average已接入视频生成官方 runtime待验证本地 / 无 APIIPV-Benchipv-bench仓内 official runtime 对生成视频逐 prompt 评分ipv_bench_average已接入视频生成官方 runtime待验证本地 / 无 APIiWorld-Benchiworld-bench仓内 official runtime 对生成视频逐 prompt 评分iworldbench_average已接入世界模型官方 runtimeOfficial Runtime Ready Real Data Validation Pending本地 / 无 APIMemoBenchmemobench仓内 official runtime 对生成视频逐 prompt 评分memobench_average已接入视频生成官方 runtime待验证本地 / 无 APIMiraBenchmirabench仓内 official runtime 对生成视频逐 prompt 评分mirabench_average已接入视频生成官方 runtime待验证本地 / 无 APIPhyEduVideophyeduvideo导入预计算 metric 并归一化为 scorecardphyeduvideo_average已接入视频生成Artifact 导入Result Importer Ready本地 / 无 APIPhyFPS-Bench-Genphyfps-bench-gen仓内 official runtime 对生成视频逐 prompt 评分phyfps_bench_gen_average已接入视频生成官方 runtimeOfficial Runtime Ready本地 / 无 APIPhyGenBenchphygenbench导入预计算 metric 并归一化为 scorecardphygenbench_average已接入视频生成Artifact 导入Bounded Component Ready本地 / 无 APIPhyGroundphyground导入预计算 metric 并归一化为 scorecardphyground_overall已接入视频生成Artifact 导入Result Importer Ready本地 / 无 APIPhysics-IQ Originalphysics-iq仓内 official runtime 对生成视频逐 prompt 评分physics_iq_score已接入视频生成官方 runtimeIn Tree Raw Video Evaluator本地 / 无 APIPhysics-IQ Verifiedphysics-iq-verified仓内 official runtime 对生成视频逐 prompt 评分physics_iq_verified_score已接入视频生成官方 runtimeIn Tree Raw Video Evaluator本地 / 无 APIPhysVidBenchphysvidbench导入预计算 metric 并归一化为 scorecardphysvidbench_average已接入视频生成Artifact 导入Bounded Caption Qa Ready本地 / 无 APIT2VSafetyBencht2v-safety-bench仓内 official runtime 对生成视频逐 prompt 评分nsfw_average已接入视频生成官方 runtime待验证本地 / 无 APIT2VWorldBencht2vworldbench仓内 official runtime 对生成视频逐 prompt 评分world_knowledge_average已接入世界模型官方 runtime待验证本地 / 无 APIVideoPhyvideophy仓内 judge / VLM 对生成视频逐 prompt 评分videophy_average已接入视频生成Judge runtimeIn Tree Official Runtime Ready本地 / 无 APIVideoPhy2videophy2仓内 judge / VLM 对生成视频逐 prompt 评分joint_score已接入视频生成Judge runtimeIn Tree Official Runtime Ready本地 / 无 APIVideoScience-Benchvideoscience-bench仓内 official runtime 对生成视频逐 prompt 评分videoscience_average已接入视频生成官方 runtime待验证本地 / 无 APIVideoVersevideoverse仓内 judge / VLM 对生成视频逐 prompt 评分;部分维度可能调用 hosted APIvideoverse_average已接入视频生成Judge runtimeOfficial Runtime Ready托管 APIVisual Chronometervisual-chronometer仓内 official runtime 对生成视频逐 prompt 评分visual_chronometer_average已接入视频生成官方 runtimeOfficial Runtime Ready本地 / 无 APIVMBenchvmbench仓内 official runtime 对生成视频逐 prompt 评分vmbench_average已接入视频生成官方 runtime待验证本地 / 无 APIWBenchwbench仓内 official runtime 对生成视频逐 prompt 评分wbench_average已接入世界模型官方 runtimeIn Tree Runtime本地 / 无 APIWorld-in-Worldworld-in-world导入预计算 metric 并归一化为 scorecardworld_in_world_average已接入世界模型Artifact 导入Result Importer Ready本地 / 无 APIWorldArenaworldarena闭环仿真 rollout,或归一化官方 rollout 结果ewm_score已接入世界模型官方 runtimeIn Tree Video Quality Runtime本地 / 无 APIWRBenchwrbench仓内 official runtime 对生成视频逐 prompt 评分wrbench_average已接入世界模型官方 runtime待验证本地 / 无 APIBEHAVIOR-1Kbehavior1k导入官方 / 上游结果并归一化为 scorecardsuccess_rate仅归一化具身 AI官方结果导入仅归一化本地 / 无 APIBridgeData V2bridgedata-v2导入官方 / 上游结果并归一化为 scorecardsuccess_rate仅归一化具身 AI官方结果导入仅归一化本地 / 无 APICALVINcalvin导入官方 / 上游结果并归一化为 scorecardsuccess_rate仅归一化具身 AI官方结果导入仅归一化本地 / 无 APIKinetixkinetix导入官方 / 上游结果并归一化为 scorecardsuccess_rate仅归一化具身 AI官方结果导入仅归一化本地 / 无 APILIBEROlibero导入官方 / 上游结果并归一化为 scorecardsuccess_rate仅归一化具身 AI闭环仿真仅归一化本地 / 无 APILIBERO-Memlibero-mem导入官方 / 上游结果并归一化为 scorecardsuccess_rate仅归一化具身 AI官方结果导入仅归一化本地 / 无 API每个 Benchmark 配方记录什么
详情页直接由 benchmark catalog 与 task manifest 生成,不再依赖人工维护的长链接列表。每个配方会把下面几类声明分开呈现:
| 记录 | 可以确认什么 |
|---|---|
| Catalog | 稳定 benchmark ID、领域、别名、官方来源与集成状态。 |
| Evaluation surface | 主要指标、artifact layout、judge 要求与可用执行路径。 |
| Runtime | 仓内 evaluator、外部结果导入、托管 judge 或仿真环境边界。 |
| Verification | Manifest 当前记录的 runner 或 normalizer 最高验证证据。 |
| Eligibility | 现有证据是否足以支持 leaderboard-facing 声明。 |
本 Hub 不发布 leaderboard 排名。缺失或待完成的验证会明确显示,不会被提升为更强的支持声明。
安装 benchmark-specific package 前先看运行环境矩阵。该页面区分统一环境、仓库管理的独立环境、托管 judge service,以及 dimension-specific native/checkpoint stack。
如何运行一个 Benchmark
先打开对应 benchmark 配方。Prompt 文件、generated-artifact layout、checkpoint 名称、judge model 和 official result 格式都是 benchmark-specific 的。
导入 Official Result 文件
worldfoundry-eval zoo benchmark-run \
--benchmark-id <benchmark-id> \
--mode official-validation \
--official-results-path <official-result-file-or-dir> \
--generated-artifact-dir <generated-artifact-dir> \
--output-dir tmp/<benchmark-id>/official-validation \
--json给生成产物评分
只有 benchmark 配方明确说明仓内 runtime 可以从 generated artifacts 重新计算分数,并且所需 checkpoint 已准备好时,才使用 official-run:
worldfoundry-eval zoo benchmark-run \
--benchmark-id <benchmark-id> \
--mode official-run \
--generated-artifact-dir <generated-artifact-dir> \
--output-dir tmp/<benchmark-id>/official-run \
--json需要先用已注册模型生成 artifact 时:
worldfoundry-eval run \
--benchmark <benchmark-id> \
--model <model-id> \
--mode official-run \
--output-dir tmp/<benchmark-id>/<model-id> \
--json





































