В Таблице 1 приведены все соотношения, по которым могут быть дополнительно оценены комплексы с точки зрения возможности их эффективного использования на разнообразных задачах пользователя. Другими словами, эти соотношения характеризуют сложность программирования на тех или иных системах, имея в виду, что всегда есть стремление достичь максимальной производительности вычислительных средств на решаемой задаче. Чем меньшие значения имеют правые части этих соотношений, тем легче выполнить условие полной загрузки системы. Произведение этих коэффициентов может дать качественную характеристику всего комплекса Крез по эффективности его использования на различных классах задач. Для такой интегральной оценки необходимо правильно выбрать значения Qд и Пэт, так как они могут влиять на весовые характеристики этих коэффициентов. Анализ решения больших задач показывает, что для многих из них локализация данных во многих случаях может быть выполнена на объеме памяти Qд = 1 GB. Величина Пэт, как уже говорилось, может быть выбрана исходя из средней производительности процессора сегодняшнего дня 1GFlops.
Приведенные оценки качества вычислительных комплексов указывают только возможные принципы нового подхода к анализу вычислительных средств при их выборе для использования в тех или иных сферах деятельности. Неполнота приведенных соотношений заключается прежде всего в том, что при определении пропускной способности канала процессор - ОЗУ не учитываются особенности построения сверхоперативной памяти (быстрые регистры, КЭШ, различные буферные устройства и т.д.). При определении пропускной способности между ОЗУ и внешней памятью не учитываются реальные возможности внешних устройств и телекоммуникационных систем, выходящих на вычислительные средства, и т.д. Однако, принципы развития и уточнения этих оценок достаточно ясны и могут быть без труда найдены для каждого конкретного случая.
Привлекательность приведенных оценок состоит в том, что все эти коэффициенты могут быть легко рассчитаны на основании рекламных данных, выдаваемых фирмами. В качестве примера приведем анализ некоторых современных многопроцессорных систем и многомашинных комплексов.
Результаты анализа многопроцессорных систем фирмы Convex (SPP-1200, SPP-2000), фирмы DEC (Server8400) и фирмы Cray (j916, C-90 и Т-90) приведены в Таблице 2.
Таблица 2. Многопроцессорные системы (распределяемая память)
|
Фирма |
Система |
Базовый процессор |
Параметры кластера |
Коэффициент эффективности загрузки |
R= |
Примечания |
||||||||||
|
Наименование |
f, МГц |
Ппр, GFls |
N |
Eпр, GBs |
E, GB s |
P, GFls |
Q, GB |
КМП |
КМПП |
Кпр |
Крез |
Kрез-P |
||||
|
CONVEX |
SPP-1200 |
PA-7200 |
120 |
0.24 |
8 |
1 |
0.27 |
1.9 |
2 |
5.5 |
1.5 |
4 |
33 |
4 |
На аппаратно-программном уровне поддерживается объединение |
|
|
CONVEX |
SPP-2000 |
PA-8000 |
180 |
0.7 |
16 |
7.6 |
1.72 |
11.2 |
4 |
4 |
2 |
1 |
8 |
0.7 |
до 32 кластеров с коррекцией КЭШ |
|
|
DEС |
Server 8400 |
Alpha 21164 |
300 |
0.5 |
12 |
2.4 |
1.2 |
6.0 |
3 |
2 |
2 |
2 |
8 |
1.3 |
||
|
Cray |
Cray j916 |
Набор |
100 |
0.2 |
16 |
26 |
1.6 |
3.2 |
4 |
16 |
1 |
5 |
80 |
26 |
||
|
Cray |
Cray C 90 |
Набор |
240 |
1 |
16 |
245 |
13.6 |
16 |
8 |
18 |
1 |
1 |
18 |
1.1 |
||
|
Cray |
Cray T-90 |
Набор |
470 |
2 |
32 |
950 |
54.4 |
64 |
16 |
18 |
1 |
0.5 |
9 |
0.13 |
архитектура суперпроцессор высокопроизводительный
Таблица 3. Многомашинные комплексы (распределенная память)
|
Фирма |
Система |
Базовый процессор |
Параметры кластера |
Параметры комплекса |
Коэффициент эффективности загрузки |
R= |
|||||||||||||||
|
Наименование |
f МГц |
Ппр MFls |
Nу |
Eпр MB s |
E MB s |
Qу МB |
в |
N |
NEпр GB s |
EМ GB s |
P GFls |
QM GB |
Кму |
Кммп |
Кпр |
Км |
Крез |
Крез --------- P |
|||
|
Cray |
Сray T3D |
Alpha 21064 |
150 |
150 |
2 |
37 |
76 |
64 |
3 |
1024 |
150 |
4.8 |
150 |
64 |
24 |
2 |
6 |
30 |
8.6x103 |
60 |
|
|
Cray |
Cray T3E |
Alpha 21164 |
300 |
600 |
1 |
1200 |
480 |
128 |
3 |
1024 |
600 |
64 |
600 |
128 |
22 |
4 |
1 |
9 |
2.9x103 |
4 |
|
|
IBM |
SP2 |
Power-2 |
77 |
280 |
1 |
260 |
40 |
128 |
2 |
128 |
30 |
5 |
30 |
16 |
14 |
2 |
4 |
9 |
104 |
300 |
Из таблиц видно, что каждая фирма хорошо чувствует недостатки своей системы и при последующей реализации устраняет их, улучшая тем самым оценочные коэффициенты. Так, фирма Convex улучшила обмен ОЗУ кластера с внешней памятью и каналами телекоммуникации и увеличила производительность процессора. Фирма Cray существенно увеличила объем ОЗУ в узле, повысила его пропускную способность с другими узлами и увеличила общую пропускную способность с каналами связи и внешним полем.
Данная качественная сравнительная оценка комплексов с точки зрения возможностей аппаратных средств сделана с точки зрения общих принципов организации этих структур, поэтому в большей степени характеризует их как универсальные вычислительные средства. Поэтому чем выше Крез, тем этот комплекс более специализирован для решения определенного класса задач.
Необходимо отметить, что полученные соотношения подразумевают отсутствие задержки в цепях коммутации, не учитывают сложности в достижении корректности работы КЭШ памяти и предполагают, что задачи на всем времени их решения обеспечивают параллельность вычислительных процессов P NСк.
Тот же подход к анализу структур универсальных суперЭВМ можно использовать и для определения перспектив их развития. Приведенные соотношения фактически характеризуют различные комплексы с точки зрения возможности их загрузки, то есть получения реальной производительности (Рреал), т.к. максимальная производительность комплекса Рмах мало кого интересует, хотя именно она фигурирует в рекламных проспектах. Таким образом, качество структуры комплекса будет определяться отношением Рреал/Рмах и будет обратно пропорционально Крез
Рреал Рмах /Крез.
Создавая перспективный комплекс суперЭВМ для задач с высоким параллелизмом вычислительных процессов, учитывая сегодняшнее состояние элементной базы (в особенности в части возможности создания памяти больших объемов) можно достаточно легко выполнить следующие соотношения:
Qд / Q 1; Qn NПпр/ Q 1; NyПпр = Еу; b = 1.
Учитывая, что Q = NQу, получим следующие качественные соотношения:
Рреал 0 Рреал м пр ПпрЕ
Рреал мм ПпрЕм 1/N, (4)
где Рреал 0, Рреал м пр и Рреал мм - реальная производительность соответственно для однопроцессорной, многопроцессорной и многомашинной структуры суперЭВМ.
Можно сделать два немаловажных вывода из полученных соотношений:
- основным средством увеличения реальной производительности вычислительного комплекса в независимости от его структуры является увеличение производительности базового процессора (Ппр) с обеспечением его необходимой пропускной способностью с внешней памятью (Е);
- многомашинные комплексы на больших задачах, имеющих общие данные параллельных процессов, не позволят достичь высокой реальной производительности комплекса из-за невозможности локализации данных в объеме Q/N = Qу.
Этим обстоятельством и объясняется тот факт, что все фирмы, производящие вычислительные средства, много средств вкладывают в разработку все более высокопроизводительных микропроцессоров. Однако на пути увеличения производительности одного процессора существуют определенные ограничения - статистика показывает, что наблюдается аппаратное насыщение в проектировании микропроцессоров, состоящее в том, что увеличение аппаратных средств (числа вентилей) микропроцессора не приводит к пропорциональному увеличение его производительности. Объяснить это можно тем, что основным средством увеличения производительности новых микропроцессоров является увеличение числа их исполнительных устройств. Оставаясь в рамках фон-Неймановского принципа организации вычислительного процесса, добиться увеличения производительности процессора с увеличением числа исполнительных устройств весьма проблематично. Вывод один - необходимо отходить от фон-Неймановского принципа организации вычислительного процесса внутри микропроцессора. Первый шаг в этом направлении был сделан в центральном процессоре МВК «Эльбрус-1» при использовании безадресных быстрых регистров. В настоящее время американские фирмы в своих публикациях без ссылки на первоисточник говорят о локальном использовании принципа «управления данными» в микропроцессорных структурах.
Прежде чем говорить о направлениях работ по созданию перспективных суперЭВМ производительностью 1015 оп/с, необходимо в какой-то мере определить, что мы будем понимать под названием микропроцессор или базовый процессор комплекса. Дело в том, что в настоящее время микропроцессор или базовый процессор становится довольно сложным комплексом параллельной работы многих вычислительных устройств таких как исполнительные устройства, представляющие собой спецпроцессоры, сверхоперативную и оперативную память с возможностями расширения и той и другой, развитую системы ввода-вывода данных. Естественно встает вопрос, чем же этот комплекс устройств отличается от, например, многопроцессорного комплекса.
Можно отметить два отличительных свойства микропроцессора:
- аппаратное распределение ресурсов вычислительных средств в процессе выполнения вычислительного процесса;
- аппаратное обеспечение правильной во времени последовательности команд выполняемой им программы с учетом синхронизации их по данным.
Очевидно придерживаясь выполнения этих принципов и должен строиться новый процессор.
Наиболее полно отвечает этим двум условиям процессор, построенный по принципу работы управления данными. В отличие от фон-Неймановского принципа этот принцип предполагает выявление на каждый вычислительный шаг всех операций, выполнение которых может производиться одновременно, с пошаговой синхронизацией всего вычислительного процесса по данным. До настоящего времени практическая реализация этого принципа считалась невозможной.
Безусловно, реализация процессора на принципе управления данными имеет много подводных камней, которые на сегодняшний день можно считать разрешимыми. Подтверждением этого являются работы, проводимые в течение 7 лет ОИВТА РАН по теме ОСВМ РАН. В то же время этот принцип позволяет на порядок увеличить число исполнительных устройств микропроцессора и вести весь вычислительный процесс по конвейерному принципу, т.к. исключена фон-Неймановская связанность последовательных команд по данным.
В настоящее время в США ставится задача создания суперЭВМ производительностью 1015 оп/с, т.к. есть конкретные задачи как проблемного, так и практического характера, которые могут быть реализованы только на этой производительности вычислительных средств. Известные нам американские проекты таких комплексов в основном базируются на успехах технологии. Предполагается, что к 2005 году технологические нормы изготовления микросхем приблизятся к уровню 0,01 мкм, а задержка на вентиль составит менее 0,01 нс. Причем каждый чип будет вмещать 20 млн. вентилей или десятки микропроцессоров с памятью. Предполагается, что суперЭВМ будет состоять из чипов, содержащих 32-67 процессоров с памятью, причем каждый процессор будет обладать производительностью не менее 109 оп/с.
Естественно, что достаточно высокая реальная производительность Рреал на таких комплексах может быть достигнута на определенных классах задач, что и отмечается в проектах.
Саймер Крэй придерживался несколько другой точки зрения. Он предполагал создать процессор производительностью в 1012-1013 оп/с, и на базе таких процессоров строить комплекс перспективную суперЭВМ (высказывание 1995 года). По какой структуре Крэй собирался реализовать свой базовый процессор сведений нет. Однако есть информация, что один процессор должен был содержать 100-200 чипов.
Скорее всего при создании суперЭВМ универсального типа производительностью 1015 оп/с будут использоваться базовые процессоры, работающие по новым принципам организации вычислительного процесса, т.к. только уход от использования фон-Неймановского принципа, как основы организации процесса вычислений, позволит значительно расширить диапазон производительности одного процессора.