GeForce 400

Geforce 400 é uma família de placas gráficas desenvolvidadas pela nVidia, lançadas em 26 de março de 2010. Com novo suporte a API DirectX 11.0, filtros antialising 32CSAA, efeitos Tesselation e DOF.

NVIDIA GeForce 400
Codinome GF100 / GF104 / GF106 / GF108/ GF114 (Fermi)
Lançado em Março de 2010
GPU básica GeForce GT 420, GT 430 e GT 440
GPU Intermediária GeForce GTs 450
GPU Topo-de-linha GeForce GTX 460, GTX 460 v2 (GF114), GTX 465, GTX 470, GTX 480
Versão DirectX Direct3D 11.0, exceto GT405.

As placas gráficas Geforce 400 não têm mais suporte oficial, isto é, drivers para Windows não são mais lançados com suporte a estes modelos, pela nVidia, desde janeiro de 2019.[1]

Arquitetura

A Nvidia descreveu a Fermi (microarquitetura) como o próximo grande passo em sua linha de GPUs seguindo a Tesla (microarquitetura) usada desde o G80. O GF100, o primeiro produto da arquitetura Fermi, é grande: 512 processadores stream, em dezesseis grupos de 32, e 3,0 bilhões de transistores, fabricados pela TSMC em um processo de 40 nm. É o primeiro chip da Nvidia a suportar OpenGL 4.0 e Direct3D 11. Nenhum produto com uma GPU GF100 totalmente habilitada foi vendido. A GTX 480 tinha um multiprocessador de streaming desativado. A GTX 470 tinha dois multiprocessadores de streaming e um controlador de memória desabilitado. A GTX 465 tinha cinco multiprocessadores de streaming e dois controladores de memória desabilitados.

As placas Consumer GeForce vieram com 256 MB anexados a cada um dos controladores de memória GDDR5 habilitados, para um total de 1,5, 1,25 ou 1,0 GB; o Tesla C2050 tinha 512 MB em cada um dos seis controladores e o Tesla C2070 tinha 1024 MB por controlador. Ambas as placas Tesla tinham quatorze grupos ativos de processadores de fluxo. Os chips encontrados na marca Tesla de alto desempenho apresentam memória com ECC opcional e a capacidade de realizar uma operação de ponto flutuante de precisão dupla por ciclo por núcleo; as placas de consumo GeForce são artificialmente restritas ao driver a uma operação DP a cada quatro ciclos. Com esses recursos, combinados com o suporte para Visual Studio e C ++, a Nvidia direcionou-se aos mercados profissionais e comerciais, bem como ao uso em computação de alto desempenho.

Fermi tem o nome de físico italiano Enrico Fermi.

Limitações e compensações atuais

A quantidade de SRAM on-board por ALU na verdade diminuiu proporcionalmente em comparação com a geração G200 anterior, apesar do aumento do cache L2 de 256kB por 240 ALUs para 768kB por 512 ALUs, uma vez que Fermi tem apenas 32768 registros por 32 ALUs (vs. 16384 por 8 ALUs), apenas 48kB de memória compartilhada por 32 ALUs (vs. 16kB por 8 ALUs) e apenas 16kB de cache por 32 ALUs (vs. cache constante de 8kB por 8 ALUs + cache de textura 24kB por 24 ALUs). Parâmetros como o número de registros podem ser encontrados na Tabela de comparação de recursos de computação CUDA no manual de referência.[2]

História

Em 30 de setembro de 2009, a Nvidia lançou um white paper descrevendo a arquitetura: [3] o chip possui 16 'Streaming Multiprocessors' cada com 32 'Cores CUDA' capazes de uma operação de precisão única por ciclo ou uma operação de precisão dupla a cada dois ciclos, um espaço de endereço virtual de 40 bits que permite que a memória do host seja mapeada no espaço de endereço do chip, o que significa que há apenas um tipo de ponteiro e tornando o suporte C ++ significativamente mais fácil, e uma interface de memória de 384 bits GDDR5. Tal como acontece com G80 e GT200, os threads são programados em 'warps', conjuntos de 32 threads cada um rodando em um único shader core. Enquanto o GT200 tinha 16 KB de 'memória compartilhada' associada a cada cluster de sombreador e os dados necessários para serem lidos através das unidades de texturização se um cache fosse necessário, o GF100 tem 64 KB de memória associada a cada cluster, que pode ser usado como um Cache de 48 KB mais 16 KB de memória compartilhada, ou como um cache de 16 KB mais 48 KB de memória compartilhada, junto com um cache L2 de 768 KB compartilhado por todos os 16 clusters. O white paper descreve o chip muito mais como um processador de propósito geral para cargas de trabalho que abrangem dezenas de milhares de threads - uma reminiscência da arquitetura Tera MTA, embora sem o suporte dessa máquina para acesso aleatório à memória muito eficiente - do que um processador gráfico.

Produtos

  • 1 SPs - Shader Processors - Unified Shaders : Texture mapping units : Render output units
  • 2 Cada Streaming Multiprocessor (SM) na arquitetura GPU do GF100 contém 32 SPs e 4 SFUs. Cada Streaming Multiprocessor (SM) na GPU da arquitetura GF104 / 106/108 contém 48 SPs e 8 SFUs. Cada SP pode cumprir 2 operações de precisão única fundida multiplicação-adição (FMA) por ciclo. Cada SFU pode cumprir quatro operações SF por ciclo. Uma operação FMA conta para duas operações de ponto flutuante. Portanto, o desempenho de pico teórico de precisão simples, com contagem de shader [n] e frequência de shader [f, GHz], pode ser estimado pelo seguinte, FLOPSsp ≈ f × n × 2 (FMA). Potência de processamento total: para GF100 FLOPSsp ≈ f × m × (32 SPs × 2 (FMA) + 4 × 4 SFUs) e para GF104 / 106/108 FLOPSsp ≈ f × m × (48 SPs × 2 (FMA) + 4 × 8 SFUs) ou para GF100 FLOPSsp ≈ f × n × 2,5 e para GF104 / 106/108 FLOPSsp ≈ f × n × 8/3.[4]

SP - Processador Shader (Unified Shader, CUDA Core), SFU - Special Function Unit, SM - Streaming Multiprocessor.

  • 3 Cada SM no GF100 contém 4 unidades de filtragem de textura para cada unidade de endereço de textura. O dado GF100 completo contém 64 unidades de endereço de textura e 256 unidades de filtragem de textura[5] Cada SM na arquitetura GF104 / 106/108 contém 8 unidades de filtragem de textura para cada unidade de endereço de textura. A matriz GF104 completa contém 64 unidades de endereço de textura e 512 unidades de filtragem de textura, a matriz GF106 completa contém 32 unidades de endereço de textura e 256 unidades de filtragem de textura e a matriz GF108 completa contém 16 unidades de endereço de textura e 128 unidades de filtragem de textura.[6]

Todos os produtos são produzidos em um processo de fabricação de 40 nm. Todos os produtos suportam Direct X 12.0, OpenGL 4.6 e OpenCL 1.1. A única exceção é a Geforce 405 que é baseada no núcleo GT218, suportando apenas DirectX 10.1, OpenGL 3.3 e sem suporte OpenCL

Modelo Ano Code name Transistors (million) Die size (mm2) Bus interface SM count Core config1,3 Clock rate Fillrate Memory configuration GFLOPS (FMA)2 TDP (watts) Launch price (USD)
Core (MHz) Shader (MHz) Memory (MHz) Pixel (GP/s) Texture (GT/s) Size (MB) Bandwidth (GB/s) DRAM type Bus width (bit)
GeForce 405 (OEM) September 16, 2011 GT218 260 57 PCIe 2.0 x16 1 16:8:4 589 1402 1580 2.4 4.7 512

1024

12.6 DDR3 64 44.9 25 OEM
GeForce GT 420 (OEM) September 3, 2010 GF108 585 116 PCIe 2.0 x16 1 48:8:4 700 1400 1800 2.8 5.6 2048 28.8 GDDR3 128 134.4 50 OEM
GeForce GT 430 (OEM) October 11, 2010 GF108 585 116 PCIe 2.0 x16 2 96:16:4 700 1400 1600

1800

2.8 11.2 2048 25.6

28.8

GDDR3 128 268.8 60 OEM
GeForce GT 430 October 11, 2010 GF108 585 116 PCIe 2.0 x16 2 96:16:4 700 1400 1800 2.8 11.2 1024 28.8 GDDR3 128 268.8 49 $79
GeForce GT 440 February 1, 2011 GF108 585 116 PCIe 2.0 x16 2 96:16:4 810 1620 1800

3200

3.24 13.2 512

1024 2048

28.8

51.2

GDDR3

GDDR5

128 311 65 $79
GeForce GT 440 (OEM) October 11, 2010 GF106 1170 238 PCIe 2.0 x16 3 144:24:24 594 1189 1800 14.26 14.26 1536

3072

43.2 GDDR3 192 342.4 56 OEM
GeForce GTS 450 (OEM) October 11, 2010 GF106 1170 238 PCIe 2.0 x16 3 144:24:24 790 1580 1804 18.96 18.96 1024

1536

86 GDDR5 192 455 106 OEM
GeForce GTS 450 September 13, 2010 GF106 1170 238 PCIe 2.0 x16 4 192:32:16 783 1566 1804 12.53 25.06 512

1024 2048

57.73 GDDR3

GDDR5

128 601.3 106 $129
GeForce GTX 460 SE November 15, 2010 GF104 1950 332 PCIe 2.0 x16 6 288:48:32 650 1300 3400 20.8 31.2 1024 108.8 GDDR5 256 748.8 150 $160?-$180?
GeForce GTX 460 (OEM) October 11, 2010 GF104 1950 332 PCIe 2.0 x16 7 336:56:24 650 1300 3400 20.8 36.4 1024 108.8 GDDR5 256 873.6 150 OEM
GeForce GTX 460 July 12, 2010 GF104 1950 332 PCIe 2.0 x16 7 336:56:24 675 1350 3600 16.2 37.8 768 86.4 GDDR5 192 907.2 150 $199
336:56:32 21.6 1024

2048

115.2 256 160 $229
GeForce GTX 460 v2 September 24, 2011 GF114 1950 332 PCIe 2.0 x16 7 336:56:24 778 1556 4008 18.67 43.57 1024 96.2 GDDR5 192 1045.6 160 $199
GeForce GTX 465 May 31, 2010 GF100 3200 529 PCIe 2.0 x16 11 352:44:32 607 1215 3206 19.42 26.71 1024 102.6 GDDR5 256 855.4 200 $279
GeForce GTX 470 March 26, 2010 GF100 3200 529 PCIe 2.0 x16 14 448:56:40 607 1215 3348 24.28 34 1280 133.9 GDDR5 320 1088.6 215 $349
GeForce GTX 480 March 26, 2010 GF100 3200 529 PCIe 2.0 x16 15 480:60:48 700 1401 3696 33.60 42 1536 177.4 GDDR5 384 1345 250 $499

Em 8 de novembro de 2010, a Nvidia lançou o chip GF110, junto com o GTX580 (substituição do 480). É um chip GF100 redesenhado, que usa muito menos energia. Isso permitiu que a Nvidia habilitasse todos os 16 SMs (todos os 16 núcleos), o que antes era impossível na GF100 «NVIDIA GeForce GTX 580» Vários recursos da arquitetura GF100 estavam disponíveis apenas nas séries de placas Quadro e Tesla mais caras.[7] Para os produtos de consumo GeForce, o desempenho de precisão dupla é um quarto do da arquitetura Fermi "completa". A memória de verificação e correção de erros (ECC) também não funciona em cartões do consumidor. [8] As placas GF100 fornecem capacidade de computação 2.0, enquanto as placas GF104 / 106/108 fornecem capacidade de computação 2.1.

Suporte descontinuado

A Nvidia anunciou que após o lançamento dos drivers 390, não lançará mais drivers de 32 bits para sistemas operacionais de 32 bits.[8]

A Nvidia anunciou em abril de 2018 que Fermi mudará para o status de suporte de driver legado e será mantido até janeiro de 2019.[9]

Referências

Ver também

Ligações externas

This article is issued from Wikipedia. The text is licensed under Creative Commons - Attribution - Sharealike. Additional terms may apply for the media files.