ESM-2 Protein Embeddings - Sequence Families
3,164 sequencesbiologyproteinscosine
A TMAP of 3,164 protein sequences built from ESM-2 embeddings (650M parameter model) using cosine distance. The tree clusters sequences by structural and functional similarity as captured by the language model. Color layers include protein family (categorical) and sequence length (continuous). Demonstrates how TMAP works with dense protein embeddings from large language models - the same workflow applies to ESM-2 (3B), ProtTrans, or any protein encoder that produces fixed-length vectors.
ESM-2 Protein Embeddings - Sequence FamiliesOpen full page
Loading interactive demo…
How it was made
generate.pypython
from tmap import TMAP
from tmap.utils.proteins import read_fasta, sequence_properties
# Load ESM-2 embeddings (precomputed)
embeddings = np.load("esm2_embeddings.npy") # (N, 1280)
model = TMAP(metric="cosine", n_neighbors=15, seed=42)
model.fit(embeddings.astype(np.float32))
viz = model.to_tmapviz()
viz.add_color_layout("Family", families, categorical=True, color="tab20")
viz.add_color_layout("Length", seq_lengths, categorical=False, color="viridis")
viz.add_label("Seq ID", sequence_ids)
viz.write_html("esm650.html")