Benchmark evaluation for tabular ML: Elo, win-rate, rank and improvability leaderboards (the engine behind TabArena)
A required part of this site couldn’t load. This may be due to a browser extension, network issues, or browser settings. Please check your connection, disable any ad blockers, or try using a different browser.
| # | Наименование новости | Тональность | Информативность | Дата публикации |
|---|---|---|---|---|
| 1 | tabarena 0.1.1.dev20260925063612 | 0 | 10 | 25-09-2026 |
| 2 | flakelens 0.1.0 | 0 | 18.33 | 25-09-2026 |
| 3 | whichllm - поиск лучшей LLM модели под оборудование | 0 | 10 | 08-06-2026 |
| 4 | harbor - framework for running agent evaluations | 0 | 10 | 02-03-2026 |
| 5 | A leakage-aware benchmark for evaluating chemical and cellular generalization in single-cell perturbation-response prediction | 0 | 31.05 | 10-08-2026 |
| 6 | StableEval Arena: A Cost-Aware Agentic Benchmark for Stablecoin Price Stability Prediction | 0 | 21.76 | 07-08-2026 |
| 7 | PyPy: A new benchmark runner for PyPy | 0 | 7.35 | 20-06-2026 |
| 8 | From Programs to Predictions: A Scalable, Multilingual Platform for Automated Evaluation of Machine-Learning Olympiads | 0 | 5 | 14-07-2026 |
| 9 | btech-agent-lab 1.14.0 | 0 | 5 | 20-07-2026 |
| 10 | gaussia 1.1.0b8 | 0 | 6.94 | 14-08-2026 |