VibeProteinBench: An Evaluation Benchmark for Language-interfaced Vibe Protein Design Paper • 2605.10978 • Published May 13 • 19
Predicting LLM Reasoning Performance with Small Proxy Model Paper • 2509.21013 • Published Sep 25, 2025 • 6
Cross-Modal Retrieval Meets Inference:Improving Zero-Shot Classification with Cross-Modal Retrieval Paper • 2308.15273 • Published Aug 29, 2023 • 1
The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models Paper • 2406.05761 • Published Jun 9, 2024 • 3
Self-Training Elicits Concise Reasoning in Large Language Models Paper • 2502.20122 • Published Feb 27, 2025 • 4