GeForce 400
Geforce 400 é uma família de placas gráficas desenvolvidadas pela nVidia, lançadas em 26 de março de 2010. Com novo suporte a API DirectX 11.0, filtros antialising 32CSAA, efeitos Tesselation e DOF.
| NVIDIA GeForce 400 | |
|---|---|
| Codinome | GF100 / GF104 / GF106 / GF108/ GF114 (Fermi) |
| Lançado em | Março de 2010 |
| GPU básica | GeForce GT 420, GT 430 e GT 440 |
| GPU Intermediária | GeForce GTs 450 |
| GPU Topo-de-linha | GeForce GTX 460, GTX 460 v2 (GF114), GTX 465, GTX 470, GTX 480 |
| Versão DirectX | Direct3D 11.0, exceto GT405. |
As placas gráficas Geforce 400 não têm mais suporte oficial, isto é, drivers para Windows não são mais lançados com suporte a estes modelos, pela nVidia, desde janeiro de 2019.[1]
Arquitetura
A Nvidia descreveu a Fermi (microarquitetura) como o próximo grande passo em sua linha de GPUs seguindo a Tesla (microarquitetura) usada desde o G80. O GF100, o primeiro produto da arquitetura Fermi, é grande: 512 processadores stream, em dezesseis grupos de 32, e 3,0 bilhões de transistores, fabricados pela TSMC em um processo de 40 nm. É o primeiro chip da Nvidia a suportar OpenGL 4.0 e Direct3D 11. Nenhum produto com uma GPU GF100 totalmente habilitada foi vendido. A GTX 480 tinha um multiprocessador de streaming desativado. A GTX 470 tinha dois multiprocessadores de streaming e um controlador de memória desabilitado. A GTX 465 tinha cinco multiprocessadores de streaming e dois controladores de memória desabilitados.
As placas Consumer GeForce vieram com 256 MB anexados a cada um dos controladores de memória GDDR5 habilitados, para um total de 1,5, 1,25 ou 1,0 GB; o Tesla C2050 tinha 512 MB em cada um dos seis controladores e o Tesla C2070 tinha 1024 MB por controlador. Ambas as placas Tesla tinham quatorze grupos ativos de processadores de fluxo. Os chips encontrados na marca Tesla de alto desempenho apresentam memória com ECC opcional e a capacidade de realizar uma operação de ponto flutuante de precisão dupla por ciclo por núcleo; as placas de consumo GeForce são artificialmente restritas ao driver a uma operação DP a cada quatro ciclos. Com esses recursos, combinados com o suporte para Visual Studio e C ++, a Nvidia direcionou-se aos mercados profissionais e comerciais, bem como ao uso em computação de alto desempenho.
Fermi tem o nome de físico italiano Enrico Fermi.
Limitações e compensações atuais
A quantidade de SRAM on-board por ALU na verdade diminuiu proporcionalmente em comparação com a geração G200 anterior, apesar do aumento do cache L2 de 256kB por 240 ALUs para 768kB por 512 ALUs, uma vez que Fermi tem apenas 32768 registros por 32 ALUs (vs. 16384 por 8 ALUs), apenas 48kB de memória compartilhada por 32 ALUs (vs. 16kB por 8 ALUs) e apenas 16kB de cache por 32 ALUs (vs. cache constante de 8kB por 8 ALUs + cache de textura 24kB por 24 ALUs). Parâmetros como o número de registros podem ser encontrados na Tabela de comparação de recursos de computação CUDA no manual de referência.[2]
História
Em 30 de setembro de 2009, a Nvidia lançou um white paper descrevendo a arquitetura: [3] o chip possui 16 'Streaming Multiprocessors' cada com 32 'Cores CUDA' capazes de uma operação de precisão única por ciclo ou uma operação de precisão dupla a cada dois ciclos, um espaço de endereço virtual de 40 bits que permite que a memória do host seja mapeada no espaço de endereço do chip, o que significa que há apenas um tipo de ponteiro e tornando o suporte C ++ significativamente mais fácil, e uma interface de memória de 384 bits GDDR5. Tal como acontece com G80 e GT200, os threads são programados em 'warps', conjuntos de 32 threads cada um rodando em um único shader core. Enquanto o GT200 tinha 16 KB de 'memória compartilhada' associada a cada cluster de sombreador e os dados necessários para serem lidos através das unidades de texturização se um cache fosse necessário, o GF100 tem 64 KB de memória associada a cada cluster, que pode ser usado como um Cache de 48 KB mais 16 KB de memória compartilhada, ou como um cache de 16 KB mais 48 KB de memória compartilhada, junto com um cache L2 de 768 KB compartilhado por todos os 16 clusters. O white paper descreve o chip muito mais como um processador de propósito geral para cargas de trabalho que abrangem dezenas de milhares de threads - uma reminiscência da arquitetura Tera MTA, embora sem o suporte dessa máquina para acesso aleatório à memória muito eficiente - do que um processador gráfico.
Produtos
- 1 SPs - Shader Processors - Unified Shaders : Texture mapping units : Render output units
- 2 Cada Streaming Multiprocessor (SM) na arquitetura GPU do GF100 contém 32 SPs e 4 SFUs. Cada Streaming Multiprocessor (SM) na GPU da arquitetura GF104 / 106/108 contém 48 SPs e 8 SFUs. Cada SP pode cumprir 2 operações de precisão única fundida multiplicação-adição (FMA) por ciclo. Cada SFU pode cumprir quatro operações SF por ciclo. Uma operação FMA conta para duas operações de ponto flutuante. Portanto, o desempenho de pico teórico de precisão simples, com contagem de shader [n] e frequência de shader [f, GHz], pode ser estimado pelo seguinte, FLOPSsp ≈ f × n × 2 (FMA). Potência de processamento total: para GF100 FLOPSsp ≈ f × m × (32 SPs × 2 (FMA) + 4 × 4 SFUs) e para GF104 / 106/108 FLOPSsp ≈ f × m × (48 SPs × 2 (FMA) + 4 × 8 SFUs) ou para GF100 FLOPSsp ≈ f × n × 2,5 e para GF104 / 106/108 FLOPSsp ≈ f × n × 8/3.[4]
SP - Processador Shader (Unified Shader, CUDA Core), SFU - Special Function Unit, SM - Streaming Multiprocessor.
- 3 Cada SM no GF100 contém 4 unidades de filtragem de textura para cada unidade de endereço de textura. O dado GF100 completo contém 64 unidades de endereço de textura e 256 unidades de filtragem de textura[5] Cada SM na arquitetura GF104 / 106/108 contém 8 unidades de filtragem de textura para cada unidade de endereço de textura. A matriz GF104 completa contém 64 unidades de endereço de textura e 512 unidades de filtragem de textura, a matriz GF106 completa contém 32 unidades de endereço de textura e 256 unidades de filtragem de textura e a matriz GF108 completa contém 16 unidades de endereço de textura e 128 unidades de filtragem de textura.[6]
Todos os produtos são produzidos em um processo de fabricação de 40 nm. Todos os produtos suportam Direct X 12.0, OpenGL 4.6 e OpenCL 1.1. A única exceção é a Geforce 405 que é baseada no núcleo GT218, suportando apenas DirectX 10.1, OpenGL 3.3 e sem suporte OpenCL
| Modelo | Ano | Code name | Transistors (million) | Die size (mm2) | Bus interface | SM count | Core config1,3 | Clock rate | Fillrate | Memory configuration | GFLOPS (FMA)2 | TDP (watts) | Launch price (USD) | ||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Core (MHz) | Shader (MHz) | Memory (MHz) | Pixel (GP/s) | Texture (GT/s) | Size (MB) | Bandwidth (GB/s) | DRAM type | Bus width (bit) | |||||||||||
| GeForce 405 (OEM) | September 16, 2011 | GT218 | 260 | 57 | PCIe 2.0 x16 | 1 | 16:8:4 | 589 | 1402 | 1580 | 2.4 | 4.7 | 512
1024 |
12.6 | DDR3 | 64 | 44.9 | 25 | OEM |
| GeForce GT 420 (OEM) | September 3, 2010 | GF108 | 585 | 116 | PCIe 2.0 x16 | 1 | 48:8:4 | 700 | 1400 | 1800 | 2.8 | 5.6 | 2048 | 28.8 | GDDR3 | 128 | 134.4 | 50 | OEM |
| GeForce GT 430 (OEM) | October 11, 2010 | GF108 | 585 | 116 | PCIe 2.0 x16 | 2 | 96:16:4 | 700 | 1400 | 1600
1800 |
2.8 | 11.2 | 2048 | 25.6
28.8 |
GDDR3 | 128 | 268.8 | 60 | OEM |
| GeForce GT 430 | October 11, 2010 | GF108 | 585 | 116 | PCIe 2.0 x16 | 2 | 96:16:4 | 700 | 1400 | 1800 | 2.8 | 11.2 | 1024 | 28.8 | GDDR3 | 128 | 268.8 | 49 | $79 |
| GeForce GT 440 | February 1, 2011 | GF108 | 585 | 116 | PCIe 2.0 x16 | 2 | 96:16:4 | 810 | 1620 | 1800
3200 |
3.24 | 13.2 | 512
1024 2048 |
28.8
51.2 |
GDDR3
GDDR5 |
128 | 311 | 65 | $79 |
| GeForce GT 440 (OEM) | October 11, 2010 | GF106 | 1170 | 238 | PCIe 2.0 x16 | 3 | 144:24:24 | 594 | 1189 | 1800 | 14.26 | 14.26 | 1536
3072 |
43.2 | GDDR3 | 192 | 342.4 | 56 | OEM |
| GeForce GTS 450 (OEM) | October 11, 2010 | GF106 | 1170 | 238 | PCIe 2.0 x16 | 3 | 144:24:24 | 790 | 1580 | 1804 | 18.96 | 18.96 | 1024
1536 |
86 | GDDR5 | 192 | 455 | 106 | OEM |
| GeForce GTS 450 | September 13, 2010 | GF106 | 1170 | 238 | PCIe 2.0 x16 | 4 | 192:32:16 | 783 | 1566 | 1804 | 12.53 | 25.06 | 512
1024 2048 |
57.73 | GDDR3
GDDR5 |
128 | 601.3 | 106 | $129 |
| GeForce GTX 460 SE | November 15, 2010 | GF104 | 1950 | 332 | PCIe 2.0 x16 | 6 | 288:48:32 | 650 | 1300 | 3400 | 20.8 | 31.2 | 1024 | 108.8 | GDDR5 | 256 | 748.8 | 150 | $160?-$180? |
| GeForce GTX 460 (OEM) | October 11, 2010 | GF104 | 1950 | 332 | PCIe 2.0 x16 | 7 | 336:56:24 | 650 | 1300 | 3400 | 20.8 | 36.4 | 1024 | 108.8 | GDDR5 | 256 | 873.6 | 150 | OEM |
| GeForce GTX 460 | July 12, 2010 | GF104 | 1950 | 332 | PCIe 2.0 x16 | 7 | 336:56:24 | 675 | 1350 | 3600 | 16.2 | 37.8 | 768 | 86.4 | GDDR5 | 192 | 907.2 | 150 | $199 |
| 336:56:32 | 21.6 | 1024
2048 |
115.2 | 256 | 160 | $229 | |||||||||||||
| GeForce GTX 460 v2 | September 24, 2011 | GF114 | 1950 | 332 | PCIe 2.0 x16 | 7 | 336:56:24 | 778 | 1556 | 4008 | 18.67 | 43.57 | 1024 | 96.2 | GDDR5 | 192 | 1045.6 | 160 | $199 |
| GeForce GTX 465 | May 31, 2010 | GF100 | 3200 | 529 | PCIe 2.0 x16 | 11 | 352:44:32 | 607 | 1215 | 3206 | 19.42 | 26.71 | 1024 | 102.6 | GDDR5 | 256 | 855.4 | 200 | $279 |
| GeForce GTX 470 | March 26, 2010 | GF100 | 3200 | 529 | PCIe 2.0 x16 | 14 | 448:56:40 | 607 | 1215 | 3348 | 24.28 | 34 | 1280 | 133.9 | GDDR5 | 320 | 1088.6 | 215 | $349 |
| GeForce GTX 480 | March 26, 2010 | GF100 | 3200 | 529 | PCIe 2.0 x16 | 15 | 480:60:48 | 700 | 1401 | 3696 | 33.60 | 42 | 1536 | 177.4 | GDDR5 | 384 | 1345 | 250 | $499 |
Em 8 de novembro de 2010, a Nvidia lançou o chip GF110, junto com o GTX580 (substituição do 480). É um chip GF100 redesenhado, que usa muito menos energia. Isso permitiu que a Nvidia habilitasse todos os 16 SMs (todos os 16 núcleos), o que antes era impossível na GF100 «NVIDIA GeForce GTX 580» Vários recursos da arquitetura GF100 estavam disponíveis apenas nas séries de placas Quadro e Tesla mais caras.[7] Para os produtos de consumo GeForce, o desempenho de precisão dupla é um quarto do da arquitetura Fermi "completa". A memória de verificação e correção de erros (ECC) também não funciona em cartões do consumidor. [8] As placas GF100 fornecem capacidade de computação 2.0, enquanto as placas GF104 / 106/108 fornecem capacidade de computação 2.1.
Suporte descontinuado
A Nvidia anunciou que após o lançamento dos drivers 390, não lançará mais drivers de 32 bits para sistemas operacionais de 32 bits.[8]
A Nvidia anunciou em abril de 2018 que Fermi mudará para o status de suporte de driver legado e será mantido até janeiro de 2019.[9]
Referências
- NVIDIA Ends Driver Support For Fermi (GeForce 400 / 500 Series) GPUs, Moved To Legacy Status – 32-bit OS Drivers Support Also Ended site: wccftech
- Compute Capability Comparison Table in «Page 147-148, Appendix G.1, CUDA 3.1 official reference manual» (PDF). Page 97 in Appendix A lists the older NVIDIA GPUs and shows all G200 series to be compute capability 1.3, while Fermi-based cards have compute capability 2.x (page 14, Section 2.5).
- http://www.nvidia.com/content/PDF/fermi_white_papers/NVIDIA_Fermi_Compute_Architecture_Whitepaper.pdf
- siliconmadness.com (2010). «Nvidia Announces Tesla 20 Series». Arquivado do original em 21 de maio de 2010
- NVIDIA's GeForce GTX 480 and GTX 470: 6 Months Late, Was It Worth the Wait?
- NVIDIA’s GeForce GTX 460: The $200 King
- «Statement by NVIDIA on their General CUDA GPU Computing Discussion forum»
- «Support Plan for 32-bit and 64-bit Operating Systems | NVIDIA». nvidia.custhelp.com. Consultado em 23 de abril de 2021
- «Support Plan for Fermi series GeForce GPUs | NVIDIA». nvidia.custhelp.com. Consultado em 23 de abril de 2021
Ver também
- Microarquitetura Fermi, a arquitetura usada por essa linha de GPUs.
Ligações externas
- «The Next Generation of Nvidia GeForce» (em inglês)
- «Nvidia Parallel Nsight». (em inglês)