Benchmarking Large Language Model Uncertainty for Prompt Optimization
Guo, Pei-Fu, Tsai, Yun-Da, Lin, Shou-De
–arXiv.org Artificial Intelligence
Prompt optimization algorithms for Large Language Models (LLMs) excel in multi-step reasoning but still lack effective uncertainty estimation. This paper introduces a benchmark dataset to evaluate uncertainty metrics, focusing on Answer, Correctness, Aleatoric, and Epistemic Uncertainty.
arXiv.org Artificial Intelligence
Sep-16-2024
- Country:
- Asia
- Taiwan (0.05)
- British Indian Ocean Territory > Diego Garcia (0.04)
- Middle East > Saudi Arabia
- Asir Province > Abha (0.04)
- Asia
- Genre:
- Research Report (0.82)
- Industry:
- Health & Medicine (0.46)
- Technology: