ARM представи най-новия си дизайн на процесор — Cortex-A77. Както и миналогодишният Cortex-A76, това ядро е предназначено за висококласни задачи в смартфони и разнообразни устройства. В него разработчикът се стреми към увеличаване на броя на командите, изпълнявани на такт (IPC). Тактовите честоти и енергийното потребление остават приблизително на нивото на Cortex-A76.

В момента ARM бързо нацелва увеличение на производителността на своите ядра. Според плановете ѝ, започвайки с Cortex-A73 от 2016 година и до дизайна Hercules от 2020 година, компанията планира да увеличи мощността на ЦП с 2,5 пъти. Преходите от 16 нм на 10 нм и след това на 7 нм вече позволиха увеличаване на тактовата честота, а в комбинация с архитектурата Cortex-A75 и след това Cortex-A76, по оценките на ARM, към днешна дата е постигнат 1,8-кратен ръст на производителността. Сега ядро Cortex-A77 ще позволи, благодарение на увеличението на IPC, да увеличи производителността с още 20 % при запазена тактова честота. Тоест 2,5-кратното увеличение през 2020 година става напълно реализуемо.

Въпреки увеличението на IPC с 20 %, според оценките на ARM, енергийното потребление на A77 не е нараснало. Компромисът в случая е, че площта на кристала A77 е приблизително с 17 % по-голяма от A76 при едни и същи технологични норми. В резултат на това разходите за отделно ядро ще се увеличат малко. Ако сравним постижението на ARM с лидерите в бранша, ще трябва да кажем, че AMD в Zen 2 е постигнала ръст на IPC с 15 % в сравнение с Zen+, а стойността на IPC при ядрата на Intel в продължение на много години остава приблизително на едно ниво.

Размерът на прозореца за изпълнение с пренареждане на командите (out-of-order window size) е увеличен с 25 %, до 160 единици, което позволява на ядрото да увеличи паралелизма на изчисленията. Дори в Cortex-A76 имаше голям буфер за адреси на преходи (Branch Target Buffer), а в Cortex-A77 той е увеличен с още 33 %, до 8 KB, което позволява на блока за предсказване на разклоненията да се справя ефективно с увеличаването на броя на паралелните инструкции.

Друго интересно нововъведение е напълно новият 1,5Кбайт кеш, в който се съхраняват макрооперациите (MOP), връщани от декодиращия модул. Архитектурата на ARM процесора декодира инструкциите от потребителското приложение в по-малки макрооперации, които след това се разделят на микрооперации, предавани на ядрото на изпълнението. MOP кешът се използва за намаляване на влиянието на пропуснатите клонения и нулирания, тъй като сега макрооперациите се съхраняват в отделен блок и не изискват повторно декодиране — така се увеличава общата пропускна способност на ядрото. В някои натоварвания новият блок е изключително полезно допълнение към стандартния кеш на инструкциите.


В ядрото на изпълнението е добавен четвърти ALU блок и втори блок за клонения. Четвъртият ALU увеличава общата пропускна способност на процесора с 1,5 пъти, благодарение на възможността за изпълнение на едноциклови инструкции (като ADD и SUB) и двуциклови целочислени операции, като умножение. Останалите два ALU могат да обработват само основните едноциклови инструкции, докато последният блок се зарежда с по-сложни математически операции, като деление и умножение с натрупване и др. Вторият блок за клонения в ядрото на изпълнението удвоява броя на паралелните клонения, с които ядрото може да работи, което е полезно в случаи, когато две от шестте изпратени команди са клонения. Вътрешното тестване в ARM показа повишение на производителността при използването на този втори блок за клонения.


Сред другите промени в ядрото – добавяне на втори конвейер за шифруване AES, увеличение на пропускната способност на паметта, усъвършенстван механизъм за предварително извличане на данни от ново поколение, който позволява повишаване на енергийната ефективност и едновременно увеличение на пропускната способност на системата DRAM, оптимизации на работата на кеша и др.


Най-голямото увеличение се наблюдава в Cortex-A77 в целочислените операции и изчисленията с плаваща запетая. Това е потвърдено от вътрешни тестове на ARM в SPEC, които показаха увеличение на производителността с 20 % и 35 % съответно в целочислените операции и изчисленията с плаваща запетая. Подобренията в пропускната способност на паметта са в диапазона от 15-20 %. В общи линии, оптимизациите и измененията в A77 дават средно увеличение на производителността с 20 % в сравнение с предходното поколение. Чрез по-новите технологични стандарти, като 7 nm ULV, можем да получим допълнителни предимства в крайни чипове.


ARM разработи Cortex-A77 за работа в свързване 4+4 big.LITTLE (4 мощни ядра и 4 обикновени енергоефективни). Но, предвид увеличената площ на новата архитектура, много производители с цел икономия могат да предлагат комбинации 1+3+4 или 2+2+4, които вече активно се практикуват, където само едно или две ядра ще бъдат пълноценни, неурезани A77.

Източник: 3dnews.ru
