← Feed

Dispersion loss counteracts embedding condensation in small language models

rss:hn · Jul 3, 2026 · source