-
-
Save mwzero/e1db21578265cc849070a76b2f14036f to your computer and use it in GitHub Desktop.
Table in medium
This file contains hidden or bidirectional Unicode text that may be interpreted or compiled differently than what appears below. To review, open the file in an editor that reveals hidden Unicode characters.
Learn more about bidirectional Unicode characters
| Modello | Architettura | Parametri | Altre informazioni | |
|---|---|---|---|---|
| LLaMA 3 | Transformer | 8B e 70B | Addestrato su 15 trilioni di token, supporto multilingue, ottimizzato per codifica e generazione creativa | |
| GPT-NeoX | Transformer | fino a 20B | Progetto di EleutherAI, addestrato su Pile, un vasto dataset open source | |
| BLOOM | Transformer | 176B | Creato da BigScience, supporta 46 lingue e 13 linguaggi di programmazione | |
| T5 | Transformer | fino a 11B | Progetto di Google, ottimizzato per compiti di NLP come traduzione e riassunto | |
| Mistral | MoE | fino a 12B | Utilizza un'architettura MoE per migliorare l'efficienza e la scalabilità | |
| DeepSeek | MoE | fino a 671B | Modello avanzato con velocità di inferenza migliorata, supporta multilingue | |
| Qwen | MoE e Dense | fino a 72B | Modelli di Alibaba Cloud, supportano multilingue e vari compiti di NLP | |
| Gemma | Transformer | 2B e 7B | Modelli di Google DeepMind, basati sulla ricerca Gemini, disponibili in versioni base e istruzione-tuning | |
| Phi | Transformer | 2.7B e 14B | Modelli di Microsoft, ottimizzati per compiti di ragionamento complesso e applicazioni avanzate |
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment