Scaling and evaluating sparse autoencoders

TM
Trevor McFedries
@trevvyboi

Sparse autoencoders provide a promising unsupervised approach for extracting interpretable features from a language model by reconstructing activations from a sparse bottleneck layer. Since language models learn many concepts, autoencoders need to be very l...

Uploaded
Uploaded Jul 10, 2026
Queried
Queried 0 times

No preview text is available for this document yet.

Want to learn more?

Ask a question