Статья: Перспективы развития высокопроизводительных средств вычислительной техники

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

В Таблице 1 приведены все соотношения, по которым могут быть дополнительно оценены комплексы с точки зрения возможности их эффективного использования на разнообразных задачах пользователя. Другими словами, эти соотношения характеризуют сложность программирования на тех или иных системах, имея в виду, что всегда есть стремление достичь максимальной производительности вычислительных средств на решаемой задаче. Чем меньшие значения имеют правые части этих соотношений, тем легче выполнить условие полной загрузки системы. Произведение этих коэффициентов может дать качественную характеристику всего комплекса Крез по эффективности его использования на различных классах задач. Для такой интегральной оценки необходимо правильно выбрать значения Qд и Пэт, так как они могут влиять на весовые характеристики этих коэффициентов. Анализ решения больших задач показывает, что для многих из них локализация данных во многих случаях может быть выполнена на объеме памяти Qд = 1 GB. Величина Пэт, как уже говорилось, может быть выбрана исходя из средней производительности процессора сегодняшнего дня 1GFlops.

Приведенные оценки качества вычислительных комплексов указывают только возможные принципы нового подхода к анализу вычислительных средств при их выборе для использования в тех или иных сферах деятельности. Неполнота приведенных соотношений заключается прежде всего в том, что при определении пропускной способности канала процессор - ОЗУ не учитываются особенности построения сверхоперативной памяти (быстрые регистры, КЭШ, различные буферные устройства и т.д.). При определении пропускной способности между ОЗУ и внешней памятью не учитываются реальные возможности внешних устройств и телекоммуникационных систем, выходящих на вычислительные средства, и т.д. Однако, принципы развития и уточнения этих оценок достаточно ясны и могут быть без труда найдены для каждого конкретного случая.

Привлекательность приведенных оценок состоит в том, что все эти коэффициенты могут быть легко рассчитаны на основании рекламных данных, выдаваемых фирмами. В качестве примера приведем анализ некоторых современных многопроцессорных систем и многомашинных комплексов.

Результаты анализа многопроцессорных систем фирмы Convex (SPP-1200, SPP-2000), фирмы DEC (Server8400) и фирмы Cray (j916, C-90 и Т-90) приведены в Таблице 2.

Таблица 2. Многопроцессорные системы (распределяемая память)

Фирма

Система

Базовый процессор

Параметры кластера

Коэффициент эффективности загрузки

R=

Примечания

Наименование

f, МГц

Ппр, GFls

N

Eпр, GBs

E, GB s

P, GFls

Q, GB

КМП

КМПП

Кпр

Крез

Kрез-P

CONVEX

SPP-1200

PA-7200

120

0.24

8

1

0.27

1.9

2

5.5

1.5

4

33

4

На аппаратно-программном уровне поддерживается объединение

CONVEX

SPP-2000

PA-8000

180

0.7

16

7.6

1.72

11.2

4

4

2

1

8

0.7

до 32 кластеров с коррекцией КЭШ

DEС

Server 8400

Alpha 21164

300

0.5

12

2.4

1.2

6.0

3

2

2

2

8

1.3

Cray

Cray j916

Набор

100

0.2

16

26

1.6

3.2

4

16

1

5

80

26

Cray

Cray C 90

Набор

240

1

16

245

13.6

16

8

18

1

1

18

1.1

Cray

Cray T-90

Набор

470

2

32

950

54.4

64

16

18

1

0.5

9

0.13

архитектура суперпроцессор высокопроизводительный

Таблица 3. Многомашинные комплексы (распределенная память)

Фирма

Система

Базовый процессор

Параметры кластера

Параметры комплекса

Коэффициент эффективности загрузки

R=

Наименование

f

МГц

Ппр

MFls

Nу

Eпр

MB

s

E

MB

s

Qу

МB

в

N

NEпр

GB

s

EМ

GB

s

P

GFls

QM

GB

Кму

Кммп

Кпр

Км

Крез

Крез

---------

P

Cray

Сray T3D

Alpha 21064

150

150

2

37

76

64

3

1024

150

4.8

150

64

24

2

6

30

8.6x103

60

Cray

Cray T3E

Alpha 21164

300

600

1

1200

480

128

3

1024

600

64

600

128

22

4

1

9

2.9x103

4

IBM

SP2

Power-2

77

280

1

260

40

128

2

128

30

5

30

16

14

2

4

9

104

300

Из таблиц видно, что каждая фирма хорошо чувствует недостатки своей системы и при последующей реализации устраняет их, улучшая тем самым оценочные коэффициенты. Так, фирма Convex улучшила обмен ОЗУ кластера с внешней памятью и каналами телекоммуникации и увеличила производительность процессора. Фирма Cray существенно увеличила объем ОЗУ в узле, повысила его пропускную способность с другими узлами и увеличила общую пропускную способность с каналами связи и внешним полем.

Данная качественная сравнительная оценка комплексов с точки зрения возможностей аппаратных средств сделана с точки зрения общих принципов организации этих структур, поэтому в большей степени характеризует их как универсальные вычислительные средства. Поэтому чем выше Крез, тем этот комплекс более специализирован для решения определенного класса задач.

Необходимо отметить, что полученные соотношения подразумевают отсутствие задержки в цепях коммутации, не учитывают сложности в достижении корректности работы КЭШ памяти и предполагают, что задачи на всем времени их решения обеспечивают параллельность вычислительных процессов P NСк.

Тот же подход к анализу структур универсальных суперЭВМ можно использовать и для определения перспектив их развития. Приведенные соотношения фактически характеризуют различные комплексы с точки зрения возможности их загрузки, то есть получения реальной производительности (Рреал), т.к. максимальная производительность комплекса Рмах мало кого интересует, хотя именно она фигурирует в рекламных проспектах. Таким образом, качество структуры комплекса будет определяться отношением Рреал/Рмах и будет обратно пропорционально Крез

Рреал Рмах /Крез.

Создавая перспективный комплекс суперЭВМ для задач с высоким параллелизмом вычислительных процессов, учитывая сегодняшнее состояние элементной базы (в особенности в части возможности создания памяти больших объемов) можно достаточно легко выполнить следующие соотношения:

Qд / Q 1; Qn NПпр/ Q 1; NyПпр = Еу; b = 1.

Учитывая, что Q = NQу, получим следующие качественные соотношения:

Рреал 0 Рреал м пр ПпрЕ

Рреал мм ПпрЕм 1/N, (4)

где Рреал 0, Рреал м пр и Рреал мм - реальная производительность соответственно для однопроцессорной, многопроцессорной и многомашинной структуры суперЭВМ.

Можно сделать два немаловажных вывода из полученных соотношений:

- основным средством увеличения реальной производительности вычислительного комплекса в независимости от его структуры является увеличение производительности базового процессора (Ппр) с обеспечением его необходимой пропускной способностью с внешней памятью (Е);

- многомашинные комплексы на больших задачах, имеющих общие данные параллельных процессов, не позволят достичь высокой реальной производительности комплекса из-за невозможности локализации данных в объеме Q/N = Qу.

Этим обстоятельством и объясняется тот факт, что все фирмы, производящие вычислительные средства, много средств вкладывают в разработку все более высокопроизводительных микропроцессоров. Однако на пути увеличения производительности одного процессора существуют определенные ограничения - статистика показывает, что наблюдается аппаратное насыщение в проектировании микропроцессоров, состоящее в том, что увеличение аппаратных средств (числа вентилей) микропроцессора не приводит к пропорциональному увеличение его производительности. Объяснить это можно тем, что основным средством увеличения производительности новых микропроцессоров является увеличение числа их исполнительных устройств. Оставаясь в рамках фон-Неймановского принципа организации вычислительного процесса, добиться увеличения производительности процессора с увеличением числа исполнительных устройств весьма проблематично. Вывод один - необходимо отходить от фон-Неймановского принципа организации вычислительного процесса внутри микропроцессора. Первый шаг в этом направлении был сделан в центральном процессоре МВК «Эльбрус-1» при использовании безадресных быстрых регистров. В настоящее время американские фирмы в своих публикациях без ссылки на первоисточник говорят о локальном использовании принципа «управления данными» в микропроцессорных структурах.

Прежде чем говорить о направлениях работ по созданию перспективных суперЭВМ производительностью 1015 оп/с, необходимо в какой-то мере определить, что мы будем понимать под названием микропроцессор или базовый процессор комплекса. Дело в том, что в настоящее время микропроцессор или базовый процессор становится довольно сложным комплексом параллельной работы многих вычислительных устройств таких как исполнительные устройства, представляющие собой спецпроцессоры, сверхоперативную и оперативную память с возможностями расширения и той и другой, развитую системы ввода-вывода данных. Естественно встает вопрос, чем же этот комплекс устройств отличается от, например, многопроцессорного комплекса.

Можно отметить два отличительных свойства микропроцессора:

- аппаратное распределение ресурсов вычислительных средств в процессе выполнения вычислительного процесса;

- аппаратное обеспечение правильной во времени последовательности команд выполняемой им программы с учетом синхронизации их по данным.

Очевидно придерживаясь выполнения этих принципов и должен строиться новый процессор.

Наиболее полно отвечает этим двум условиям процессор, построенный по принципу работы управления данными. В отличие от фон-Неймановского принципа этот принцип предполагает выявление на каждый вычислительный шаг всех операций, выполнение которых может производиться одновременно, с пошаговой синхронизацией всего вычислительного процесса по данным. До настоящего времени практическая реализация этого принципа считалась невозможной.

Безусловно, реализация процессора на принципе управления данными имеет много подводных камней, которые на сегодняшний день можно считать разрешимыми. Подтверждением этого являются работы, проводимые в течение 7 лет ОИВТА РАН по теме ОСВМ РАН. В то же время этот принцип позволяет на порядок увеличить число исполнительных устройств микропроцессора и вести весь вычислительный процесс по конвейерному принципу, т.к. исключена фон-Неймановская связанность последовательных команд по данным.

В настоящее время в США ставится задача создания суперЭВМ производительностью 1015 оп/с, т.к. есть конкретные задачи как проблемного, так и практического характера, которые могут быть реализованы только на этой производительности вычислительных средств. Известные нам американские проекты таких комплексов в основном базируются на успехах технологии. Предполагается, что к 2005 году технологические нормы изготовления микросхем приблизятся к уровню 0,01 мкм, а задержка на вентиль составит менее 0,01 нс. Причем каждый чип будет вмещать 20 млн. вентилей или десятки микропроцессоров с памятью. Предполагается, что суперЭВМ будет состоять из чипов, содержащих 32-67 процессоров с памятью, причем каждый процессор будет обладать производительностью не менее 109 оп/с.

Естественно, что достаточно высокая реальная производительность Рреал на таких комплексах может быть достигнута на определенных классах задач, что и отмечается в проектах.

Саймер Крэй придерживался несколько другой точки зрения. Он предполагал создать процессор производительностью в 1012-1013 оп/с, и на базе таких процессоров строить комплекс перспективную суперЭВМ (высказывание 1995 года). По какой структуре Крэй собирался реализовать свой базовый процессор сведений нет. Однако есть информация, что один процессор должен был содержать 100-200 чипов.

Скорее всего при создании суперЭВМ универсального типа производительностью 1015 оп/с будут использоваться базовые процессоры, работающие по новым принципам организации вычислительного процесса, т.к. только уход от использования фон-Неймановского принципа, как основы организации процесса вычислений, позволит значительно расширить диапазон производительности одного процессора.

Выводы

Основным направлением повышения реальной производительности перспективной суперЭВМ является увеличение производительности базового процессора до 1011-1012 оп/с.

Для построения универсальных суперЭВМ предпочтительной является структура многопроцессорных комплексов (распределяемая оперативная память).

Многомашинные комплексы (распределенная память) могут использоваться для определенного класса задач.

Отход от фон-Неймановского, как базового, принципа организации вычислительного процесса, включая микропроцессорные структуры, позволит значительно расширить производительность универсальной суперЭВМ.

В.С. Бурцев. «Система массового параллелизма с автоматическим распределением аппаратных средств суперЭВМ в процессе решения задачи.» Юбилейный сборник трудов институтов ОИВТА РАН. М. 1995, т. 2, с. 5-27

Источник: https://otherreferats.allbest.ru/download/1069291/