Scaling and evaluating sparse autoencoders
TM
Trevor McFedries
@trevvyboi
Sparse autoencoders provide a promising unsupervised approach for extracting interpretable features from a language model by reconstructing activations from a sparse bottleneck layer. Since language models learn many concepts, autoencoders need to be very l...
- Uploaded
- Uploaded Jul 9, 2026
- Queried
- Queried 0 times
No preview text is available for this document yet.
Want to learn more?
Ask a question