Alles über Prozessor-Caches | Bit-Rauschen 2026/19
Shownotes
Prozessoren bestehen nicht nur aus Rechenwerken und zahlreichen Controllern für RAM, PCI Express und andere Schnittstellen. Sondern sie enthalten auch sehr viel schnellen Pufferspeicher, den sogenannten Cache.
Caches stecken in allen aktuellen x86-Prozessoren von AMD und Intel, in ARM-Prozessoren für Server und Smartphones sowie auch in RISC-V-Prozessoren. Fast alle haben sogar mehrere unterschiedliche Caches: Level 1, Level 2, Level 3, manchmal sogar Level 4 oder Level 0. Zudem gibt es System Level Cache.
Wie unterscheiden sich diese Caches, was bringen sie und wie entscheiden CPU-Designer, wie viel Cache es sein soll? Der c’t-Redakteur Christian Hirsch spricht mit seinem Kollegen Christof Windeck über CPU-Caches in Folge 2026/19 von „Bit-Rauschen, der Prozessor-Podcast von c’t“.
Alle Podcast-Folgen sowie auch alle c’t-Kolumnen "Bit-Rauschen" finden Sie unter ct.de/bit-rauschen
Noch mehr Lust auf Podcasts? Hier finden Sie noch viele weitere aus dem Heise-Universum: Hören Sie von uns – unsere Podcasts
Transkript anzeigen
00:00:00: Herzlich willkommen zu Bittrauschen, der Prozessor-Podcast von CT.
00:00:06: Heute geht es um CPU Caches – also die schnellen bis super schnellen Pufferspeicher in Prozessoren!
00:00:14: Bis gleich!
00:00:31: Hallo mein Name ist Christoph Windeck.
00:00:34: heute spreche ich mit meinem CT-Kollegen Christian Hirsch über.
00:00:42: Da gibt es eine Menge vertragter Zusammenhänge, die uns Christian sehr gerne erklären wird.
00:00:49: Hallo Christian!
00:00:51: Hallo Christoph, schön dass du wieder dabei sein darfst.
00:00:55: Was unsere Zuhörerinnen und Zuhöhrer nicht sehen ist das du in unserem kleinen Lagerraum sitzt.
00:01:04: Wir nehmen gar nicht in einem Studio auf, das machen wir manchmal.
00:01:08: Jetzt sitze ich in meinem Homeoffice und habe hier so einen tollen Vorhang damit es sich halt.
00:01:15: Es hat sich rausgestellt dass die Krustelkammer hinter dem CT-Labor, wo auch Kripus Christian arbeitet also einem der eigentlich ist das ein normaler Büroraum aber sehr gute akustische Eigenschaften hat.
00:01:29: und da ist man auch ungestört.
00:01:32: Ja und ich sehe halt immer im Hintergrund von Christian die ganzen ollen Kartons stehen, aber sie machen eine super akustische Umgebung.
00:01:42: Also es ist ne gute... Es ist ne sehr gute Umgebungen um über Prozessoren und Caches zu reden weil da nämlich noch viele alte Mainboards und so was rumliegen.
00:01:51: Prozessoren eher nicht, die stehen in einem anderen Schrank oder lagern an einen anderen Schränk.
00:01:55: Worauf ich hinaus will ist wo kommt eigentlich dieser seltsame Begriff Cash her?
00:02:02: Englischen.
00:02:03: Bedeutet so viel wie Zwischenlager oder Vorrat und Stamm vom Französianwurt für Versteckner, also Cachier ab?
00:02:11: Ja Das heißt es geht um ein Ein Zwischen lager.
00:02:17: das hat ja erst mal gar nichts mit Geschwindigkeit zu tun sondern Bezieht sich erst mal darauf, dass also da irgendwas gelagert wird.
00:02:26: Aber bei Prozessor Caches geht es ja nunmal um Geschwindigkeit.
00:02:30: Dazu wurden die überhaupt erfunden und werden sie bis heute eingesetzt.
00:02:33: Kannst du das Prinzip erstmal so ganz einfach erklären bevor wir in diese fisselligen Details kommen?
00:02:39: Also die CPU-Kerne rechnen ja heute unfassbar schnell.
00:02:43: Die tanken mit bis zu sechs Gigahertz oder der Arbeitsspeicher ist aber deutlich langsamer.
00:02:49: Geschwindigkeitsgefälle einfach mal ums sozusagen.
00:02:51: und die Prozessoren bestehen ja auch aus mehreren Kernen.
00:02:56: Und die Kerne können jeweils auf mehrere Befehle ausführen, wenn aber diese Kerne und diese ganzen Rechenwerke keine Daten bekommen dann können sie ja nichts tun.
00:03:05: Das ist ein Problem!
00:03:07: Zum Vergleich hat der gesagt Prozessorntakt mit bis zu sechs Gigahertz und beim Rahmen sind wir bei Geschwindigkeiten.
00:03:16: Aktuelle DDR-Fünfrahmen mit sechstausendvierhunderte Geschwindigkeit ist man schon bei hundert Gigabyte pro Sekunde, aber das ist im Vergleich zu der Geschwindigkei die der Prozessor verarbeiten kann immer noch extrem langsam.
00:03:28: Weil der RAM sechsteausend vierhunderter taktet mit drei Komma zwei Gigahertz.
00:03:31: Das DDR ist dann quasi Double Data Rate und dadurch ergibt es denn diese Sechstausend Vierhunderter Zahl.
00:03:39: Aber also der Durchsatz ist nicht so.
00:03:43: das Problem, bis der Prozess überhaupt das erste Bit bekommt, was er möchte.
00:03:49: Vergehen die sogenannten Latenzen.
00:03:52: also es vergeht Zeit weil erst mal das adressiert werden muss an welcher Stelle im RAM liegt das?
00:03:58: und das gibt halt bestimmte Kenngrößen an.
00:04:00: vielleicht kennen das einige Zuhörerinnen und Zuhörper.
00:04:03: auf den RAM-Modulen stehen ja so kleine Zahlen drauf zum Beispiel Für eine bestimmte Latenzzahl, dass es ein Zyklin dauert um eine bestimmter Operation im Raum auszuführen.
00:04:17: Also quasi um an eine bestimmten Stelle zu kommen.
00:04:20: und dann gibt's noch weitere natürlich zyklen.
00:04:23: das ist eine riesenlange Liste mit Subtimings und das summiert sich dann einfach auf.
00:04:29: Und dann ist man in der Regel was wir auch so messen ist man ungefähr so bei drei hundert bis fünfhundert tackzyklen das Prozesserkerns, bevor überhaupt das erste Bit überhaupt dann ankommt.
00:04:40: Wenn das dann einmal kommt, dann kommen natürlich die Daten hintereinander weg.
00:04:44: Das ist da nicht mehr so.
00:04:45: das Problem aber es dauert halt immer sehr lange und es ist ja nicht so dass die Daten alle sehr schön geordnet im Rahmen ankommen liegen sondern die sind ja ein bisschen verteilt.
00:04:56: Das heißt... Es geht vor allem darum diese Latenzen zu kaschieren Weil, wenn der Prozessor jetzt unendlich gut rechnen würde die ganze Zeit also schneller als das RAM kann ja der Cash am Ende auch nicht sein.
00:05:09: Also auf Dauer natürlich Sustained weil irgendwo müssen die Daten hierher kommen und geschrieben werden muss ja auch noch was.
00:05:15: aber es geht vor allem darum diese zufällig verteilten Zugriffe abzupuffahren oder?
00:05:19: Kann man das so sagen?
00:05:21: Ja!
00:05:22: Der Cash liegt halt dazwischen.
00:05:26: Wir machen's jetzt mal ganz einfach für einen Cash später nochmal auf die Details Und der liegt halt viel näher an den Kern, weil er ist ja im Prozessor drin.
00:05:36: Da ist der Weg einfach viel kürzer.
00:05:39: Dadurch sind diese Wattezeiten viel langsamer und die liegen halt im Schnitt so bei einem Zehntel bis zum Wundertstil vom Rahmen.
00:05:46: Also es ist enorm schneller.
00:05:49: Der Durchsatz beträgt so mehrer Terabyte pro Sekunde.
00:05:52: Das hekt natürlich ein bisschen...
00:05:55: Du hast vorher gesagt, ich glaube, ein Speicherkanal bei DDR-fünf, sechs, tausend, vierhundert hat so einen fünfzig Gigabyte Sekunde.
00:06:03: Hattest du immer im Kopf?
00:06:04: Das ist einfach diese sechs Komma viermal acht und zwei Kanäle also hundert Gigabyte.
00:06:10: Und jetzt hast du gesagt in cash hat durchsatz von terabyte pro sekund Also auch faktor ja zehnhundert zwischen zehn und paar tunsten.
00:06:21: Ja
00:06:21: genau
00:06:22: okay.
00:06:23: Jetzt ist aber der Witz ja in diesem Zwischenspeicher, deswegen heißt er ja so.
00:06:26: Sonst bräuchte man gar keinen Arbeitsspeicher dass er natürlich viel kleiner ist als der das eigentliche Ramm.
00:06:33: Also Größen sind ja üblicherweise so ein paar Dutzend Megabyte mittlerweile oder einige megabyte.
00:06:38: wenn
00:06:39: wir mal wie sagt noch noch beim jetzt nicht ins Detail geht Wenn man mal alle kisches Samrechte sind dann sind es genau paar Dutzen mega weit in der Wege.
00:06:47: Ja Aber ich habe ja eben bei dicker ausgebauten Rechnern ein paar dutzend Gigabyte beispielsweise, naja ein paar Dutzend eher nicht bei privaten Leuten.
00:06:57: Nicht mehr?
00:06:58: Nicht mehr!
00:06:59: Acht bis zweiunddreißig sagen wir mal ganz grob einen bis drei Dutzende das heißt es ist Faktor tausend.
00:07:06: die Größe der zwischen megabyte und gigabyte also passt nix rein in den Zwischenspeicher würde man jetzt erstmal denken ist ein bisschen wie bei diesen Batteriespeichern für die Stromnetze.
00:07:19: Wo man auch immer denkt, was soll der eigentlich bringen?
00:07:22: Aber es geht ja um diese Zugriffsspitzen oder sowas.
00:07:26: Kann man sich so vorstellen als Zwischenspeicher?
00:07:29: Wahrscheinlich hinkt der Vergleich entsetzlich aber es fiel mir nur gerade ein.
00:07:32: Das heißt, für mich stellt sich immer die Frage was ich am verblüffendsten finde beim Cash.
00:07:36: woher weiß denn der Cash welche Daten er am besten zwischen speichern soll?
00:07:42: Es gibt ja viel Auswahl sozusagen, Faktor hundert bis tausend.
00:07:47: Welche nimmt da?
00:07:48: Genau das ist dann der spannende.
00:07:50: Das punkt sind eigentlich relativ einfach über Statistik.
00:07:56: Wenn jetzt zum Beispiel ein Programm Daten verarbeitet, dann liegen die ja doch hintereinander weg oft.
00:08:01: Das ist zum Beispiel einen relativ einfacher Fall.
00:08:04: Dann weiß eben das Programm Okay, oder der Cash, was er gesagt hat.
00:08:09: Die Cash-Logik das Prozess ausweist ich habe jetzt das angefordert damit wahrscheinlich in den nächsten Speicherzellen die nächsten benötigten Daten liegen mit einer gewissen Wahrscheinlichkeit und dann lädt er sie eben schon mal aus Verdacht einfach schon einmal in den Cash rein und in der Regel passt es ja auch.
00:08:24: Und die Trefferwahrscheinlichkeits sind wirklich hoch.
00:08:27: Oder wenn ein Programm auf Daten zugegriffen hat ist eine gewisse Wahrscheinlichigkeit da dass ihr nochmal diese Daten braucht.
00:08:37: Das ist auch wieder so ein Faktboot, dann wieder eben der Cash-Hit.
00:08:41: Also ein Treffer im Cash vorhanden ist und eben der langsame Zugriff auf den Ramm entfällt.
00:08:47: Und natürlich das ist jetzt nur die allgemeine Sache.
00:08:49: aber diese Algorithmen sind natürlich extrem ausgeklügelt inzwischen.
00:08:53: da gibt es halt eben spezielle Einheit im Prozessor, die eben gucken was ist in der Vergangenheit?
00:08:58: In den letzten zehn, zwanzig, dreißighundert Tagzügel oder so passiert, analysieren das und treffen vorhersagen, was könnte jetzt als nächstes passieren?
00:09:10: Welche Daten könnten benötigt werden.
00:09:12: Und das versuchen die vorherzusagen und laden sie eben auch Verdacht rein.
00:09:18: Es hat eine gewisse Trefferquote aber relativ hoch ist.
00:09:23: Das heißt also mehrere statistische Effekte und alle möglichen Tricks werden kombiniert um eben dafür zu sorgen, dass Daten sozusagen schon im Cash sind bevor der Prozessor überhaupt weiß.
00:09:34: Also bevor das Programm dem Prozessorsagt du brauchst jetzt dieses Datum wurde schon was geraten und das trifft relativ häufig.
00:09:42: Das heißt man muss sich das eben nicht vorstellen als eine wie.
00:09:47: ich weiß gar nicht immer wie man das die bei so statistischen Statistischen Effekten eben erklären soll.
00:09:53: Es ist ja keine absolute Beschleunigung oder absolut vorhersagbare, aber sie klappt verblüffend gut.
00:10:00: Ja die haben das auch schon dreißig Jahre lang oder noch länger optimiert.
00:10:03: ich glaube die ersten Caches gab es bei irgendwelchen IBM Prozessoren schon in den siebziger Jahren oder sechziger jahren.
00:10:08: also da hat man sehr lange dran geforscht.
00:10:11: Insofern klappt es halt toll.
00:10:14: Aber es bleibt natürlich dass andere um das andere extrem mal zu sagen Der Cash kann also nicht alle Zugriffe abfangen, sondern immer nur einen Teil oder?
00:10:22: Das ist der SD-Sinn halt sehr klein.
00:10:24: Kommen wir später noch ein bisschen drauf was dann die tatsächlichen Größen sind und ich habe mal Wert herausgesucht.
00:10:31: das funktioniert zum Beispiel für den Level eins Cash extrem gut.
00:10:35: da sind wir bei modernen Prozessen teilweise bei ninety bis neunneinzig Prozent Trefferrate.
00:10:39: Also das ist einfach ziemlich gut.
00:10:44: Der Cash ist ja nicht nur dafür da, sondern ohne den Cash sind auch weitere Optimierung gar nicht möglich.
00:10:49: Die moderne Prozessoren haben um so schnell zu rechnen wie es sie dann in der Praxis recht
00:10:53: gibt.
00:10:54: Das ist spannend.
00:10:54: also.
00:10:55: das heißt der Cash wirkt auch indirekt indem er Dinge ermöglicht die sonst vielleicht sinnlos wären kann.
00:11:01: zum Beispiel nennen
00:11:02: Ja, das ist mal zwei Stück.
00:11:04: Das ist einmal die bekannte spekulative Ausführung auf Verdacht dabei für der Prozessor also fordert nicht nur Daten auf Verdicht an sondern führt schon Berechnungen durch, die noch gar nicht im Programmcode drin stehen.
00:11:19: An dieser Stelle zum Teil werden sie natürlich dann verwurfen weil es sich rausstellt war falsch oder gar nicht benötigt und dazu brauchen wir natürlich dann entsprechend schon wieder die Daten, die auch im Cash liegen müssen.
00:11:31: Oder das andere, wofür auch der Cache genutzt wird.
00:11:34: Dass es eben um Daten schnell zwischen verschiedenen Kernen auszutauschen.
00:11:39: Weil ja bei Multisfetting oder bei bestimmten Operationen eben das eine auf dem ein kann gerechnet wird und das nächste auf dem anderen kann oder parallel.
00:11:47: Und da müssen ja auch gleiche Daten zugegriffen werden.
00:11:50: Da wird dann typischerweise gemeinsam genutzter Cache verwendet wo dann eben der lange Umweg über das RAM wieder entfällt.
00:12:00: Jetzt haben wir grundsätzlich geklärt, was ein Cash leistet.
00:12:03: Also er vermeidet sozusagen nach Möglichkeit Rammzugriffe.
00:12:08: Das ist ja schon verblüffend wenn man da mal drüber nachdenkt, wenn du sagst dass die Level eins Cash Trefferrate so wahnsinnig hoch ist.
00:12:17: also ich hätte schon fünfzig Prozent irre gefunden.
00:12:20: das erklärt natürlich im Umkehrschluss warum super schnelles RAM beim Desktop PC das gute Overclocker-Ramm manchmal enttäuschend wenig bringt.
00:12:30: Also wenn ich nur noch zehn Prozent der Zugriffe durch stelleres RAM optimieren kann, dann ja.
00:12:37: Aber gut vielleicht sollten wir auch mal irgendwann über das RAM sprechen in diesem Podcast.
00:12:41: wie man Zugriffen da im Ram kaschiert, kann man eigentlich sagen ha-ha!
00:12:47: Weil die Zugriffer eben auch zum Beispiel überlappend durchgeführt werden um diese langen, langen Adressierungslatänzen loszuwerden.
00:12:54: Das ist aber nur nebenbei.
00:12:58: Hier, jetzt konzentrieren wir uns auf den Cash.
00:13:00: Der ist nämlich kompliziert genug denn es gibt ja du hast schon erwähnt Level Eins Cash oft auch L-Eins abgekürzt der oft auch noch unterteilt ist.
00:13:09: ich habe gesehen bei Panther Lake beim neuesten Intel Prozessor gibts sogar Level Null also Level Nullevel Eins Level Zwei Level Drei und manchmal sogar noch Level Vier.
00:13:19: Bei Arm Prozessoren oder Apple Prozessoren liest man was von System Level Cash.
00:13:30: Das ist ja tatsächlich total verwirrend.
00:13:34: Kannst du uns da ein bisschen Licht reinbringen?
00:13:36: Warum gibt es überhaupt so viele unterschiedliche Cash Typen?
00:13:40: Genau, das sind wahrscheinlich noch nicht alle.
00:13:42: Da gibt's wahrscheinlich noch eine ganze Latte mehr und um da bis mal das Licht zu bringen, der Cash soll ja so schnell wie möglich sein besteht, aber ein Cash ist ja auch hardware.
00:13:59: Also das sind Schaltkreise die bestehende aus Transistoren und teilweise auch Kondensatoren je nachdem welchen Aufbau die haben und Das nimmt ja auch Platz weg.
00:14:11: Das muss erst mal gefertigt werden Und alle elektrischen Komponenten brauchen Strom und Strom ist Leistungsaufnahme.
00:14:17: Ganz kurz mit Platz meinst du auf dem Chip?
00:14:19: Genau müssen halb Halbleiterfläche dafür hergestellt werden.
00:14:26: Das kostet alles Strom oder auch Geld, also entweder direkt in der Herstellung oder eben durch die Energiekosten.
00:14:36: und man kann ja Chips nicht beliebig groß bauen.
00:14:40: Man kann sie schon sehr groß bauen aber dann wären sich extrem teuer.
00:14:42: und es ist immer ein Kompromiss.
00:14:44: Alles im Lebenskompromiss Und was auch noch dazu kommt, also man kann eben Cashes nicht beliebig groß machen ist weil da ja auch eine Verwaltungslogik drin steckt.
00:14:56: Um den anzusprechen so ähnlich wie es beim Rammis war schon ein bisschen angeschnitten hatten und das kostet ja dann auch Zeit den Anzug sprechen.
00:15:07: mit der Fläche verlängert sich auch die Signalwege.
00:15:10: Auch da sind wieder längere Zugriffszeiten, dann dir das Resultat.
00:15:15: deshalb ist es halt immer ein Kompromiss.
00:15:16: und was man halt dann gemacht hat ist bei modernen Prozessoren dass man eben verschiedene Cache Levels hat.
00:15:22: Man hat den manchmal einfach, wir fangen mal mit dem Level-I Cache an.
00:15:26: Da steht er in erster Stelle.
00:15:27: Das ist typischerweise den Cache der von CPU Kern aus der Erste ist.
00:15:32: Der ist halt sehr klein Aber extrem dicht dran und hat sehr geringe Latenzen, das sind glaube ich nur drei CPU-Zyklen oder so was in der Dreher.
00:15:42: Also extrem schnell aber eben auch sehr klein.
00:15:44: Und du hattest es auch schon angedeutet den unterteilt man in typischerweise einen Datenlevel einscash und eine Instruktionslevel einskash.
00:15:53: In den Daten liegen einfach die Daten mit denen gearbeitet wird und die Instruktion-Cache die quasi x- eighty oder armbel fehle oder was auch immer.
00:16:02: Und die typische Größe, ich hab's mal rausgesucht.
00:16:04: Da ist man heute so je nach CDU zwischen zweiunddreißig und hundert-achtentzwanzig Kilowalt in dem Bereich.
00:16:09: Kilowalte?
00:16:10: Kilowallt!
00:16:11: Also unfassbar klein aus heutiger Sicht also jetzt mal für die Oldschool Leute kleiner als eine Diskette.
00:16:19: Aber unfassbarschnell.
00:16:21: Wie gesagt, vor uns hat man ja schon mal so Werte im Terabyte pro Sekundenbereich.
00:16:29: Als nächste Zwischentube gibt es dann halt den Level-Zweigash, der ist ein bisschen größer aber eben auch wieder ein bisschen langsamer.
00:16:35: So Faktor zwei drei langsame Aber größer Das sind dann.
00:16:40: da ist man dann so bei Größen je nachdem so zwischen einen und vier Megabyte wobei Da gibt's schon wieder Unterschiede Im Aufbau.
00:16:47: Es gibt halt eben diese starken also Performance Kerne typischerweise.
00:16:50: die haben einen eigenen Level Zweigash nur für sich Und bei Intel zum Beispiel Die Effizienzkerne.
00:16:56: die teilen sich zusammen.
00:16:57: Ein gemeinsamen Level zwei Cache, vier Stück.
00:17:02: Der sogenannte Shared Cache dann?
00:17:03: Genau
00:17:04: das ist ein gemeinsam genutzter Cache wo die alle wenn jetzt nur eine Effizienz kennen aktiv ist.
00:17:08: dann hat er Glück Dann kann der den ganzen für sich nutzen.
00:17:10: Wenn jetzt aber alle Vier was tun dann müssen sie sich da irgendwie reinteilen.
00:17:17: Können darüber auch kommunizieren muss man dazu.
00:17:20: Die können ja die Daten dann gemeinsam nutzen.
00:17:22: Also
00:17:22: es kann Vorteil sein oder Nachteil.
00:17:24: Das hängt sozusagen vom Code ab
00:17:25: Richtig.
00:17:27: Und das hängt ja einfach auch von der Architektur, dass jeweils in Kerns abbekommen.
00:17:30: Später vielleicht noch ein bisschen drauf eingehen und heute gängig vor allem bei Desktop- und Mobilprozessor die Leistungsfee sind.
00:17:38: Es gibt natürlich auch noch einen Level drei Cache.
00:17:40: Der ist dann deutlich größer, der ist dann wirklich im wie man es vorhin schon angemacht hat eine Megabyte groß.
00:17:47: Das sind so gängige Größe, ein sechzehn bis oneinundzig Megabyte pro Megabyte.
00:17:53: Das ist typischerweise dann der Sharedcash.
00:17:55: Da teilen sich die Performancekerne oder die Effizienzkernblöcke wiederum in der Regel diesen gemeinsamen Level-III Cache und das ist auch in den allermeisten Fällen, der dann auch der letzte Formramm ist.
00:18:13: Okay!
00:18:14: Jetzt habe ich vorhin schon angerissen, gespoilert... Ab und zu gibt es auch mal Level IV Caches aber nicht so oft ne?
00:18:21: Genau, der ist bei zumindest Desktop-Prozessoren relativ selten.
00:18:25: Gibt es aber ab und zu mal... Das hatte Intel vor zehn Jahren gehabt bei diesen Broadwell-Prozessoren.
00:18:34: Da hatten sie ein Prozessor mit einer vergleichsweise starken Grafikeinheit und hatten dann halt der noch quasi einen extra Cash vendiert die aber auch für die CPU kennennutzbar war.
00:18:44: Das ist da eine Level IV-Cash gewesen.
00:18:47: Der war aber, glaube ich, Idee RAM.
00:18:48: Das waren eine andere Technik als die normalen Caches und in den aktuellen Prozessoren Interco Ultra-Ultra-Dreihundert also die Pedalix.
00:18:56: da gibt es zusätzlich zum L.E.N.S.L.
00:18:59: II III Cache der CPU-Kenne noch einen Memory Side Cache, der direkt nicht bei dem CPU-Cannesitzt sondern quasi im Bereich wo auch der Speicherkontroller sitzt und der ist aber für alle Komponenten in dem Prozessor eben.
00:19:13: dann sage ich mal Last Level Cache.
00:19:16: Ähm, für die Grafikeinheit ja auch.
00:19:19: Da sind ja auch zum Beispiel Cashes drin.
00:19:21: Hier haben wir meistens eine Level eins und Level zwei Cash heutzutage für den Neural Processing Unit.
00:19:25: Die muss ja auch auf den Rahmen zugreifen.
00:19:28: Für KI-Anwendungen wird die genutzt und manche IO Einheiten ne?
00:19:32: Und äh aus Sicht der CPU Kernel z.B bei Panther Lake ist das aber gar nicht der Level vier Cash sondern sogar der... ...der die fünfte Cash Ebene weil da gibt es noch eine Besonderheit.
00:19:41: Es gibt nämlich da auch ein Level Null Cash.
00:19:44: Okay, Level Null Cash finde ich jetzt ein skurriles Konzept.
00:19:48: Weil es gibt ja auch noch so Register und so weiter.
00:19:50: also wieso nennen die das Level NULL CASH?
00:19:53: Kann man da kann man da tiefer reinleuchten oder ist das...
00:19:56: Eigentlich eigentlich was sie gemacht haben das ist ja auch bei Aero Lake also den Desktop Prozessoren die jetzt aktuell sind steckt er auch drin.
00:20:03: dass ist eigentlich streng genommen ist es eigentlich L eins zum l null unbenannt haben und quasi nenl.
00:20:10: Eins Komma fünf cash noch eingeführt haben.
00:20:13: okay
00:20:13: also der zwischen level zwei cash von der Größe und vom Vom von den Latenzen unter Geschwindigkeit sitzt.
00:20:22: aber weil sie ich weiß nicht warum Sie haben es halt jetzt Level Null Cash genannt wahrscheinlich, weil sie eben nicht an diese großen die wollten hat in Level drei cash nicht anders benennen in Level vier cash deshalb Da einfach da unten.
00:20:35: Also
00:20:35: es gibt keine standardisierte Nomenklatur, das kann jeder nennen wie er will okay?
00:20:39: Das ist natürlich wie so oft dann extrem verwirrend weil jeder irgendwas behauptet.
00:20:47: Dabei fällt mir ein also als ich habe natürlich auch mal bisschen mich eingelesen vorher was für Fragen man stellen kann.
00:20:53: dabei fiel mehr auf.
00:20:55: dass war ein interessantes Argument.
00:20:56: wir haben ja vorhin gesagt der Level der Cash.
00:21:01: Ich bin schon ganz verlevelt.
00:21:02: also der Cash an sich frisst halt auch Strom.
00:21:06: Auf der anderen Seite hat Intel aber geschrieben bei diesem Panther Lake Memory Sidecash, der sozusagen diesen acht Megabyte im Memory Controller das der Strom spart.
00:21:16: Indem er Rammzugriffe vermeidet an der Stelle kann man es also kann man das generalisieren oder gilt das nur ist der Cache dann besonders langsam so zu sagen oder oder Kann man das allgemein sagen?
00:21:32: Ja, bei Mobilprozessoren ist ja die Leistung nicht immer allerhöchste Priorität.
00:21:37: Sondern eben vor allem lange Akkulaufzeit und das ist ja beim Mobilprozession so dass sie jetzt zum Beispiel den Arbeitsspeicheldynamisch runter takten können.
00:21:46: Und von daher kann ich mir das schon vorstellen, dass das in bestimmten Konstellationen natürlich dann Energie spart weil wenn die CPU wissen was tut aber nicht unbedingt das Rahmen hoch schalten muss zusätzliche memory site kechter zugrufe abhofert dann kann das durchaus auch energie sparen.
00:22:06: okay aber auch wieder ein statistischer effekt.
00:22:09: und Schlecht vorher sagen war was es genau bringt wird wahrscheinlich eben auch von dem abhängen etwas das system gerade macht.
00:22:16: Genau man kann sich auch schlecht nachmessen.
00:22:18: Man kann ja nicht sagen schalte das aus oder so.
00:22:21: Ja
00:22:23: Du hast gerade mobil prozessoren erwähnt.
00:22:26: panter leg war jetzt ein beispiel weil einfach intel gar keine aktuelle generation von pc prozessoren hat ist das im moment ist es ja eigentlich gut.
00:22:37: kann man sich heute streiten in mini pc sitzen ja auch mobilprozessoren aber auf jeden fall pentalec ist eigentlich als vor allem als mobilprozesse design worden.
00:22:46: kann man ja mittlerweile sagen schad auch nix für ein desktop.
00:22:49: früher war es ja mal anders da waren die weiter auseinander.
00:22:54: Aber ja, also auf jeden Fall von Mobilprozessoren führen mich meine Gedanken zu Smartphone-Prozessoren.
00:22:59: Das sind ja meistens Armprozessoren und haben die auch Cashes.
00:23:03: Selbstverständlich das ist jetzt nicht nur wie bei X-Achzig-Prozession wo wir jetzt privat darüber gesprochen haben sondern auch bei Armprozession ist es auch Gang und Gebe.
00:23:11: Anders würde man gar nicht auf diese Performance Level kommen.
00:23:14: oder Perfektion von heutigen Prozessoren da gibt's in der Regel halt ein L-I und L-II Cash.
00:23:21: Große L-III-Cash sind da eher nicht so verbreitet.
00:23:23: Die haben aber auch meistens noch so ein System Level Cash mit drin, der dann eben wie wir es schon angedeutet haben auch für eine Intridi GPU die natürlich auch in einem Smartphone drinnen stecken weil man will ja auf dem Display was sehen und KI-Einheiten sind ja dort.
00:23:37: also Neural Processing Units sind ja doch schon viel länger Gang und Gebe als bei Notebooks oder Desktop PCs.
00:23:44: Die stecken da ja schon seit über zehn Jahren drin Und die müssen natürlich auch wie gesagt Speicherzugriffe abgepuffert werden und von daher stecken sie auch drin, was da jetzt nicht so ist.
00:23:54: Wenn es ihnen jetzt nicht wundert der megabyte große L-Drei Caches oder so drinnen dafür das wäre einfach aus Platz und Kostengründen nicht möglich.
00:24:03: Kann man denn ganz pauschal sagen welche Anwendung besonders von einem schnellen oder großen Cash profitieren?
00:24:11: Ja also das Parade Beispiel weiß ich auch immer AMD ganz groß plakatiert Bei den X-Tradie-Prozessionen, der sehr große Alterycash ist für Spiele extrem.
00:24:24: Also
00:24:24: PC-Spiele meinst du?
00:24:25: PC-Spiele
00:24:25: genau, drei D-Spieler!
00:24:27: Weil die halt relativ viele Daten im Rahmen liegen haben einfach diese ganzen Geometrie-Daten und Texturdaten usw.. Es sind eben sehr große Datenmengen auf die auch sehr oft zugegriffen wird einfach weil das spielegeschehen ist einfach dynamisch und nicht so gut Vorher sagbar immer.
00:24:48: Und deshalb profitieren sie sehr stark von solchen Caches und deshalb haben die halt den Gamecache oder X-Tradee, oder Tradee wie Cash gibt es ja verschiedene Begriffe eingeführt und bei anderen Anwendungen wiederum zum Beispiel beim Sinebench also das ist so ein Rendering Benchmark sehen wir so gut wie kein Effekt weil da die Daten einfach sowieso so groß sind dass ihr glaube ich einfach reingestreamt werden.
00:25:15: Das heißt also der, aber der profitiert ja auch nicht von schnellem Ramm.
00:25:20: Also der scheint irgendwie die Rechenleistung erscheint die CPU so zu beschäftigen dass es gar nicht so viele da braucht.
00:25:25: So kann man sagen
00:25:28: oder sie kann gut vorhersagen was sie wann braucht und da reicht dann eben vielleicht auch eine gewisse Cashgröße.
00:25:33: wir können ja nicht wir vergleichen ja nie mit cashgrößen null du hast das hervorhin schon angedeutet sondern wahrscheinlich passen die einfach in die ohnehin vorhandenen Caches, dann bringt ein besonders großer auch nichts.
00:25:44: Das muss man ja auch immer berücksichtigen.
00:25:47: Man kann da ja immer... Die Prozessionen sind ja dermaßen komplex und dermaessen auch dynamisch.
00:25:54: Ich kann mir immer einen Seitenhieb nicht verknifen auf diese Arm versus Risk vs.
00:25:57: Sist-Destitution
00:25:58: usw.,
00:25:59: also das hat mit der reinen Lehre überhaupt nichts mehr zu tun was in diesen Prozessoren läuft.
00:26:03: Da ist alles so optimiert für die Anwendungsfälle dass man eigentlich den Effekt der reinen Lehre gar nicht mehr sieht.
00:26:12: Und nur wenn diese CPU-Designer irgendwas spektakulär falsch gemacht haben, dann sind die Puzzle halt nicht kacke!
00:26:21: Sonst kann man es eigentlich immer von anhand der Parallelität und der Taktfrequenz relativ gut vorhersagen oder einschätzen – nicht vorher sagen.
00:26:30: Die werden sich ja auch irgendwie immer ähnlicher.
00:26:32: Vielleicht ist das ein Effekt ihrer KI-Designs, dass sie da nicht mal ... wer weiß jetzt?
00:26:39: Das heißt, man kann ganz klar sagen es gibt Anwendungen.
00:26:43: Da bringt zumindest ein besonders großer Cash wenig und andere profitieren stark.
00:26:48: ich kann mich dunkel erinnern dass damals auch Manche dieser Audioprogramme Digital Audio Workstations Ich glaube als der erste M-Prozessor auf dem Markt kam da haben wir mal so von Apple haben wir Mal So einen Vergleich X-Achzig Versus Arm also im Grunde Windows gegen Mac OS auch somit so da hat.
00:27:07: unser Kollege hat mit Gieselmann viel mit diesen Digital Audio Workstations rumgemacht und da stellte sich im Grunde zufällig heraus für uns.
00:27:15: Also wir sind da ja nicht so, dass diese Audioprogramme mit den ganz vielen Tonspuren irgendwie aber nicht alle sondern manche von diesem Riesencash auch profitierten.
00:27:25: das heißt gibt auch durchaus so technische Anwendungen die profitieren Aber man kann es nicht pauschalisieren oder?
00:27:30: Man sieht es auch ein bisschen bei manchen wissenschaftlichen Simulationen.
00:27:33: Da hängt's wahrscheinlich auch von der Größe ab, also der Datenmengel die man da berechnet aber da kann das auch was bringen.
00:27:40: Es gibt auch Abseits von Spielen natürlich Anwendungen die darauf reagieren.
00:27:46: Bei Servern hängts auch von den Anwendung ab.
00:27:48: Die haben ja immer ziemlich viele Kerne inzwischen so Hundert bis Zweihundfünfzig.
00:27:55: Da kommt's aber eben drauf an... wieder von der Architektur, also die Umaufbau.
00:28:01: Weil wenn man da jetzt einen großen Casher hat dann streiten sie sich halt alle darum und ist halt eben die Frage ob sie sich gegenseitig wieder die Zugriffe blockieren.
00:28:11: Die haben dann eher ein sehr großes breites Speicherinterface mit irgendwie zwölf Kanälen.
00:28:18: Das ist dann ein anderer Weg, wie man... Da ist ja auch bei Survern spielt der Geldbeutel nicht eine ganz so große Rolle.
00:28:25: Dann kann man da auch komplexe Mainboards bauen mit vielen Dimpslots.
00:28:31: Ich meine es gäbe irgendwelche ARM Prozessoren für so Cloud Server also jetzt nicht für KI-Server.
00:28:37: Da ist das sicherlich nochmal anders und da wüsste ich im Moment gar nicht was der Vorteil ist.
00:28:41: Aber ich meine, es gäbe so... die nennen ja dann gerne Cloud-Native-Prozessoren.
00:28:45: Solche Armprozessoren und irgendeiner hat glaube ich mal eingebaut.
00:28:49: Da war irgendwie ganz wenig oder gar kein Level drei Cash dran weil sie gesagt haben wir machen dafür lieber die exklusiven Caches bei jedem Kern größer Weil in diesem Level drei doch sowieso alles durcheinander geht.
00:29:00: Ich bin mir aber nicht sicher ob sich das gehalten hat, also wie das in der nächsten Generation war.
00:29:06: Das ist mir mittlerweile entfallen.
00:29:07: aber... Also kann man sagen es gibt gar keine pauschalen Faustregeln wie großen Cash sein sollte?
00:29:13: Ne,
00:29:13: das hängt ganz immer individuell von einem einzelnen Prozessor ab und da haben die Hersteller ganz die Bachelorsimulationen an der Lüse und schauen was bringt wie viel.
00:29:25: Das werden ja schon diesen Verwaltungsaufwand erwähnt, also je größer der Cash ist umso höher sind dann auch die Latentzen.
00:29:35: Also da gibt es eine Menge Dinge, die beobachtet werden müssen.
00:29:40: Es gibt ja auch noch andere Komponenten im Prozessor drin, die auch eine gewisse Deilfläche haben wollen.
00:29:45: also das ist immer ne Abwägung.
00:29:46: Da hat jeder Hersteller je nach Produkten ein unterschiedliches Vorgehen.
00:29:53: Jetzt würde ich gerne mal drüber sprechen wie Cash eigentlich aufgebaut ist.
00:29:58: Also Prozessoren sind ja Zemos-Logic komplementäre Transistorschaltung aus zwei verschiedenen Transistortypen üblicherweise, also grundsätzlich unterschiedlichen.
00:30:14: Auf einem Chip ein paar Millionen bis Milliarden heute eher Milliarden.
00:30:19: und diese Logikschaltungen aus denen die Rechenwerke bestehen das sind ja sogenannte GATTA, also OR and solche logischen Verknüpfer.
00:30:29: daraus kann man die Rechnwerke bauen.
00:30:32: Wie ist denn der Cash-Speicherzelle aufgebaut?
00:30:34: Du hast vorhin schon gesagt, aus Transistoren.
00:30:37: Also eher nicht wie Ramm, weil in Ramm sind ja ... Ist ja so ein Speicherkondensator.
00:30:45: Das heißt es scheint anders zu sein.
00:30:47: Genau im Cash nimmt man typische Weißer, also direkt in den CPU halbleider da ist drin sitzt.
00:30:54: Man hat typischerweise S-Ram, das ist sehr schneller und nicht flüchtiger Speichertyp.
00:31:00: Startet sich das RAM Naja,
00:31:04: nicht flüchtig solange die Spannungsversorgung
00:31:06: ist.
00:31:08: Genau!
00:31:11: Es gibt manche Level IV Cash der Embedded Dramm zum Beispiel damals dieser Worldwell verwendet hat.
00:31:19: Das ist dann aber eben DRAMM.
00:31:21: das ist dann wie du schon gesagt hast ein Transistor und einen Kondensator typischerweise Und die S-Ram-Zelle besteht aber aus sechs Transistoren.
00:31:29: Deshalb sagt man auch sechs T-Sram und daran sieht man schon, dass sie halt relativ viele Transistor benötigt, dadurch eben eine große Fläche.
00:31:40: Da ist man bei einem Megabyte Cash um das mal ein Beispiel zu zeigen.
00:31:45: Bei einer Million Byte sind acht Millionen Bit und mal sechs Transistor, also vierzig Millionen Transistoren.
00:31:53: Für ein Megabyte Cash, und wer hat gesagt wie viele?
00:31:56: Welchen Größen wir inzwischen sind von Caches.
00:32:00: Und wenn man dann halt mal bei diesem X-Trade dieses zusätzliche L-Dreitschipplet nimmt was ja da oben drunter gestabelt.
00:32:09: Bei der AMD Ryzen
00:32:11: X-Tradie.
00:32:12: Genau das ist ja eine Sächtig Megabyte die dazu kommt.
00:32:15: Das sind schonmal drei Milliarden Transistoren und es ist halt schon nach Haus nochmal für In einem Frühstück in leppische, vielen sechzig megabyte speicher.
00:32:23: das ist
00:32:25: Ja das stimmt.
00:32:25: Das ist sowieso so ein thema was wir müssen vielleicht auch mal als extra machen wie die deramen heute nicht aufgebaut ist aber man weiß es gar nicht mehr so genau.
00:32:34: ganz konkret weil ja wir reden über milliardentransistoren bei Prozessoren in der zemoslogik.
00:32:42: aber wenn ich in Speicherchip habe auf einem Chip, dann sind das natürlich auch schon wie der Name schon andeutet.
00:32:51: Zweiunddreißig Milliarden Transistoren.
00:32:53: Das sind ja sogar ein paar mehr und es gibt doch noch Reserve-Transistoren,
00:32:56: d.h.,
00:32:56: also... Auch da!
00:32:58: Das sind aber Milliardentransistoren die man... Also zellen muss man sagen, aber da ist beim DRAM immer einen Transistor typischerweise, da kommt noch die Schreibleseverstärker.
00:33:08: Also das sind alles Zahlen an denen wir uns so gewöhnt haben.
00:33:12: Uns ging es jetzt darum nochmal zu erklären, dass man wirklich von dem Transistor-Budget um die Fläche konkurriert.
00:33:20: Das heißt, man könnte ja auf der gleichen Chipfläche, wo man diese SRAM-Transistoren drauf baut – damit könnte man ja auch CPU-Körner oder eine NPU, also so eine neue Unit für KI oder eine größere GPU entscheiden.
00:33:35: denn die hier CPU-Hersteller was jetzt besser ist?
00:33:38: Das ist halt wie gesagt das komplizierte Analysensimulation gefahren werden, was könnte gebraucht werden weil man muss ja auch über Bedenken.
00:33:47: Man entwickelt ja nicht ein Prozess aber quasi fürs nächste Jahr sondern die Entwicklung von neuen Generationen startet drei bis sechs sieben Jahre vorher und man kann natürlich noch im Laufe des Entwicklungsprozesses noch Änderungen vornehmen.
00:34:00: Das grobe Ganze muss ja schon irgendwie aufeinander abgestimmt sein.
00:34:03: Also nicht dass dann irgendwie die supersteigen Kerne verhungern, weil es halt eben ein Cash-Engpass gibt oder... ...oder die Frage ist auch die große Wette mit diesen Neural Processing Units?
00:34:16: Inzwischen gibt's ja langsam Software die das auch aktiv nutzt, aber ist eben auch eine Wetter gewesen auf die Zukunft.
00:34:22: Ob das wie viel das genutzt wird oder ob es nicht schauer gewesen wäre da zwei zusätzliche CPU Kerne reinzubauen.
00:34:28: Da kann man jetzt aber nicht irgendwie sagen so ist es.
00:34:32: Da ist einfach der Unterschied, welches Powerbudget habe ich?
00:34:36: Wieviel soll die CPU kosten?
00:34:37: Ist das Mobile, ist das Desktop, ist dass Server?
00:34:39: Also das ist ein Riesenbandbreiter an Dingen, die man berücksichtigen muss.
00:34:44: Würdest du soweit gehen, dass Apple einfach bei ihren M-Prozessoren oder auch bei den iPhone-Prozessoren das da so ein bisschen der Witz eigentlich liegt?
00:34:54: Dass sie diese Prozessoren sehr fein aufwalt.
00:34:57: Sie kennen ja den ganzen Software-Stack, der da läuft und wissen auch was die Leute, was ihre Kundschaft wertschätzt und braucht, dass da so'n bisschen der Witzt drin liegt wie die Prozessorindesigns sind also gar nicht so sehr... Also klar!
00:35:11: Das sind Sehr, sehr effiziente Kerne auch und so das wissen wir alles.
00:35:14: Aber dass die Gesamtabstimmung einfach besser auf das Ökosystem
00:35:19: passt.
00:35:19: Definitiv weil man muss ja immer sagen... Das klingt jetzt zu harburg ist aber nicht gemeint.
00:35:24: AMD und Intel und soweit es sind ja nur Zulieferer für DHP Lenovo und wie sie alle heißen.
00:35:29: Das ist ja nur ein Chip von ganz vielen Bauteilen die in einem Notbuch oder ein Desktop PC drin stecken.
00:35:36: Und bei Apple ist es halt so die kontrollieren halt ganz negativ gemeint einfach die komplette Kette.
00:35:41: Wie gesagt beim Chip los, übers Gerät bis zur Software- und Betriebssysteme und Compiler usw.
00:35:48: Alles aus einer Hand.
00:35:49: Und Apple hat den riesen Vorteil... Das hatte ich auch mal einen interessanten Vortrag von dem Chefentwickler von Apple gehört, dass sie die Chips schon fürs Gerät entwickeln.
00:36:01: Die wissen halt vorher wir wollen das Smartwatch mit denen und den Leistungsdaten haben können sie passgenau dafür ein chip entwickeln oder eben einen laptop wo sie sagen wir wollen in diesen wir wollen es halt lautlos gekühlt haben aber mit der performance und dann können Sie von vornherein genau an jeder kleinen stellgröße drehen während den Dell, den Niveau HP usw.
00:36:22: die natürlich reden die auch mit Intel und AMD und Qualcomm und so weiter.
00:36:26: aber sie können halt nur die Prozessoren einbauen die es halt eben von denen gibt und manche geräte sind dann eben kompromiss weil eben der Prozesse halt so viel Watt braucht und dann geht das Notbuch eben nicht passiv.
00:36:39: Und Apple hat da einfach mehr Freiheiten, was natürlich aber auch Budget erfordert weil selber ein Chip entwickeln, das macht man heute nicht mehr nebenbei.
00:36:50: Ja!
00:36:51: Die arme Firma AMD ist ja so arm muss man sagen, dass sagen die auch selber ganz offen, dass sie halt ihre jeweiligen Zen-Sex, Zen-Fünfkerne jetzt aktuell noch Zen-fünff oder auch die kompakt Kerne, da haben sie ja so eine Abweichabwandlung gemacht.
00:37:06: Sowohl im Server als auch im PC, als auch embedded, also auch im Notebook einsetzen und noch in den Spielkonsolen was ja andersrum wieder wirklich geradezu genial ist.
00:37:20: dass man einen Kern so entwickeln kann das der überall passt Ist aber natürlich eine strukturelle Kostenvorteil jetzt gegenüber.
00:37:26: weil ist vielleicht vielen nicht so bewusst, dass der so ein Panther Lake Kern also der hat mit so einem Sion Kern relativ wenig zu tun.
00:37:33: Also das ist schon dieselbe Generation und viele Rechenwerke sind gleich Aber da steckt es hat sich für Intel nur gar nicht ausgezahlt.
00:37:40: Das bisschen ironisch Im Moment jedenfalls.
00:37:45: mit den Sions sind sie so zurückgefallen.
00:37:46: Mit ihren Server-Kernen, obwohl die anders optimiert sind eben als die anderen und eben auch dieser Stapelcache der Chippletcache wurde ja genau.
00:37:54: also.
00:37:54: das ist ja diese Idee dass ich da eine Variante reinbringen kann die ich nicht in jedem Prozessor haben muss Und sogar sowas schnelles wie den Level Drei Cache separat anbinden kann Kann man sagen dass es kein Zufall ist.
00:38:07: Also mit Level zwei würde das wahrscheinlich gar nicht so einfach gehen weil der Level drei schon langsamer sein kann.
00:38:12: Genau, also bei Level zwei ist ja typischerweise bis auf ein paar Ausnahmen eben an einen Kern gebunden und da würde das glaub ich keinen Sinn ergeben.
00:38:23: Aber Level drei ist ja eh n Scherd im Cash und muss ja auch sehen, bei AMD diese größeren Desktop-Prozessionen sind ja auch Dual CCDs dann gibt es ja eigentlich streng genommen zwei Level Drei Cash's und von daher in der Hinsicht ein guter Kompromiss.
00:38:40: einfach
00:38:41: Okay, aber das war ein gutes Beispiel dafür wie komplex die Entscheidungen da sind.
00:38:45: Also bei AMD hat sich irgendeiner sehr, sehr schlauer Gedanken gemacht, wie man selbst so einen Cash über mehrere Chipplets verteilen kann und so.
00:38:53: Sehr clever!
00:38:55: Aber anfangs gab es ja auch ein bisschen Gehoppel.
00:38:57: also weiß ich noch mit dem Scheduler dass nicht jedes Spiel super profitiert hat.
00:39:02: Da musste das Betriebssystem auch sozusagen erst bis mitlernen dass eben dann die kritischen Algorithmen, die von dem Cash profitieren auch auf den richtigen Kern gelandet sind.
00:39:16: Das hat ja nicht von Anfang an so super toll funktioniert.
00:39:21: Das ist heute auch noch so... Man muss immer diesen Chipsharztreiber installiert, eigentlich der Name ist falsch, da steckt inzwischen relativ wenig vom Chipsarzt drin und da strecken auch die PPMs also diese Prozessor, Platform Power Management Dateien drin.
00:39:38: Die Windows inzwischen braucht oder was eigentlich ganz Gutes dadurch eben das Windows direkt vom Prozessehersteller Information darüber hat wie dieser Prozessor aufgebaut ist und eben auch bei diesen X-Tradee Prozessoren vor allem die mit zwei CCDs eben auf welchen CCD nun dieser Zusatz cash drauf liegt, was er gesagt oder zugeordnet ist.
00:40:00: Und das kann zwar, dass Windows irgendwie das Skekti oder irgendwie versuchen zu erraten.
00:40:05: Aber es ist halt besser wenn er genau weiß für die Anwendung nimmt das und dann wird ja auch... Das ist ja auch ganz kurze Exkurs.
00:40:13: Es wird ja eben auch, wenn sobald der an Spiel startet werden wir dann quasi bei einem sechzen Kerner eben die anderen acht Kerner ohne diesen Cash einfach hat in den Schlafenmodus versetzt.
00:40:22: Dass nur noch, auch da nur noch das aktiv ist.
00:40:24: Daran sieht man wie komplex das ist.
00:40:27: Ja Ja, das passt sehr gut zu dem was wir eingangs gesagt haben dass also der cash ist nicht einfach irgendwie da und dann wirkt er sofort sondern.
00:40:34: Der muss sehr geschickt genutzt werden sozusagen sogar vom betriebs auf Betriebssystem eben oder sagen wir scheduleer Ebene Dass man weiß dieser diese Aufgabe profitiert besonders gut von großem cash die vom schnellen cash vielleicht eher oder Und dass der eine nicht den anderen wieder jedes mal die Daten aus dem cash raus schießt.
00:40:57: Wir haben vorhin nochmal diesen translation look aside buffer erwähnt.
00:41:03: Das TLB ist auch eine andere Art von Puffer.
00:41:09: Wir sind jetzt schon relativ lange dran, deswegen dachte ich wir können wenigstens noch mal ein und den Micro App Cash wenn du uns die nochmal erklären kannst als andere Pufferspeicherbeispiele.
00:41:18: Die beiden angesprochenen Zwischenspeicher sitzen direkt in der CPU Kern drin.
00:41:23: Das kann man auch gar nicht irgendwie extra.
00:41:25: Und der translation look-aside Waffa kurz sagt, übersetzt er zwischen den virtuellen und physischen Speicheradressen.
00:41:32: Da ist einfach der Prozessor verwendet eine andere Zuordnung als tatsächlich dann die Daten im Rahmen drin liegen.
00:41:39: Das sind so virtuelle Adressbereiche.
00:41:42: Und da muss ja irgendwie übersetzt werden damit eben das auch in der richtigen Zelle landet oder geholt wird.
00:41:49: Und das andere ist der Microopcache.
00:41:50: Das ist eigentlich eine sehr schlaue Erfindung, ich glaube Intel waren mit den ersten die den eingeführt haben.
00:41:56: und zwar ist halt bei vor allem bei xx nach sich dass das Dekodieren der der xx nachtziger Befehle in diese internen Maschinenbefehler relativ aufwendig also sowohl vom vom vom Rechen oder von vom Energieaufwand vor allem.
00:42:10: und dieser micro opcach quasi puffert eben solche maschinen Befehlsketten einfach diese Micro-Obs, wie sie auch genannt wären zwischen von X-Achzigerbefehlend die dekodiert wurden und da spart man sich halt quasi die Dekodeinheiten wieder hoch zu feuern.
00:42:30: Okay!
00:42:32: Jetzt finde ich die Frage angebracht nachdem wir so viel darüber gesprochen haben wie die Daten in den Cash kommen wann fliegen denn die Daten wieder aus dem Cash heraus?
00:42:42: Ja das ist
00:42:42: der Aussage wenn er voll ist.
00:42:46: Das ist halt auch wieder Statistik im Prinzip, wenn halt einfach über einen gewissen Zeitraum auf bestimmte Zeilen keine Zugriffe erfolgt sind oder bestimmte Daten dann werden die als erstes quasi gesagt okay da hat jetzt so lange die mal zugegriffen und wir brauchen jetzt Platz.
00:43:03: Dann fliegen sie raus.
00:43:06: Ansonsten gibt es natürlich auch einfach das neuere Datum, die älteren verdrängt.
00:43:10: Das ist ganz logisch.
00:43:12: aber es werden natürlich auch irgendwie Daten einfach ungültig weil zum Beispiel in diesem Rammbereich irgendwie schon wieder neue Daten reingeschrieben wurden und verändert worden.
00:43:21: dann sind natürlich die alten Daten im Casher nicht mehr entschuldigt mit dem aktuellen Stadt.
00:43:27: Okay, das würde ich gerne nochmal genauer drauf eingehen.
00:43:34: jemand anders in den cash schreibt.
00:43:36: In der Ram,
00:43:38: äh ins Ramm schreibt dann kann ein Datum im Cash ungültig werden sagst du?
00:43:42: Ja genau da liegt ja immer irgendwie sagt nur eine Kopie eines Datums.
00:43:46: ne das Original ist also immer was zählt dass das was im Hauptspeicher liegt ne Der Cash ist ja nur ein Zwischenspeicher und nicht der Das Ausschlaggebende.
00:43:53: Und wenn jetzt durch eine Rechenoperation eben da ein datum verändert wird Ne Dann muss es ja auch passiert das mit sich erstmal im Cash, weil der sehr viel schneller ist und dann wird es natürlich auch ins Rahmen zurückgeschrieben.
00:44:04: Und wenn jetzt ein anderer Prozessor kann eben auch auf diesen Bereich zugreift und da Daten verwendet, dann kriegt er die Information... Da ist jetzt irgendwas verändert, da gibt's einen Metadaten dazu und das führt dann dazu oder das Ziel ist eben dass die Daten in sowohl den Caches und dem Rahmen immer synchron gehalten sind, dass sie immer den gleichen Stand entsprechen.
00:44:27: Ist das die berühmte Cash-Kohärenz?
00:44:32: Ja, kann man so sagen.
00:44:33: Weil ja doch vieles bei diesem Compute Express Link.
00:44:37: da ging es auch drum dass man PC Express auch cash-koärent machen kann.
00:44:41: das heißt also wenn mehrere Prozessorkerne auf mit denselben Daten arbeiten dann gibt's ja dann laufen die Sachen natürlich zeitlich auseinander und dann muss man irgendwie dafür sorgen dass das Ganze wieder synchronisiert oder ja und dann eben koärent ist Auch über diese ganzen caches hinweg.
00:45:02: Und damit wird es, finde ich vollkommen unvorstellbar wie das eigentlich in der Realität überhaupt funktioniert.
00:45:07: Finde ich mir vorstellig habe... ...sechzehn Prozessor-Kerner unterschiedliche Effizienz und P-Kerne mit unterschiedlichen Cash Leveln.
00:45:15: die einen haben gemeinsam L zwei Die anderen nur gemeinsam L drei und dann wenn er eine dahin zugreift oder ein IO-Prozess ins Ramm zugreifen ohne Prozessoren zu tun Das finde ich tatsächlich vollkommen Unvorstellber wie dieser wie man das alles synchronisiert.
00:45:34: Vorhin hast du auch noch gesagt, vielleicht können wir das auch noch... also ich weiß es gibt da Standardprotokolle aber das ist glaube ich für.. Da müsste mein sehr langen Artikel zuschreiben.
00:45:43: unser Ex-Kollege Benjamin Benz hat vor fünfzehn Jahren, zwanzig Jahre mal eingeschrieben der lange Datenweg der Daten vom Ramm ins rechten Werk, dann war das glaube ich alles genau aufgedrösselt auf dem damaligen Stand.
00:45:58: Ich wollte noch auf ein Problem hin kommen, es gibt diesen schönen Begriff des lauten Nachbarn, das noisy neighbors.
00:46:05: Du hast es vorhin schon gesagt bei den Serverprozessoren wenn ich jetzt sehr viele Kerne habe und einen gemeinsamen Cash was passiert da?
00:46:12: Kann man das...
00:46:14: Genau da gibt's halt keine Einkern geben der eben sehr viele Zugriffe macht und ständig oder dadurch die Daten von anderen Threads aus diesem gemeinsam genutzten Cashus verdrängt.
00:46:24: Das ist Cash Trashing Aber da gibt es eben auch Optimierung, die das eben verhindern sollen oder abnildern sollen.
00:46:31: Es gibt auch so... Irgendwo habe ich mal gelesen, irgendeiner wollte mit zur Quality-of-Service glaube ich bei Serverprozessoren dass sie quasi pro Kern dynamisch festlegen können der kriegt sozusagen so und so viel Cashband breiter um das um andere nicht weniger zu stören vielleicht oder einzuhägen oder sowas.
00:46:49: also da gibt's auch Ideen.
00:46:52: Du hast vorhin im Nebensatz Zeile gesagt zu cash.
00:46:59: das würde ich gerne noch vielleicht als letzten Aspekt nochmal aufdröseln.
00:47:02: wie ist der cash trakturiert?
00:47:04: also die cash zeilen cash line.
00:47:06: Ist ein feststehender begriff.
00:47:08: kannst du den noch mal vielleicht also
00:47:10: der speicher sehr intern irgendwie organisiert.
00:47:13: ne das ist ja nicht einfach nur so.
00:47:14: da sind jetzt irgendwie.
00:47:16: Sechs megabyte und viel spaß sondern da gibt es in diesem cash zahlen Cache Lines und die sind sechzig Megabyte lang.
00:47:24: Beit,
00:47:25: ich glaube ich.
00:47:27: Ja, ja, Beid.
00:47:28: Sechzig Beid lang, also fünfhundert zwölf Bit.
00:47:31: Und da gibt es aber auch noch Meter-Informationen hat ich gefunden.
00:47:34: Die sind so typischerweise fünf bis sieben Beid Lang pro Cache Line und das kommt halt eben aus dem Schweicher zu ungefähr weil man kann eben nicht wie man immer denkt auf ein einzelnes Bit zugreifen im Ramm Oder ein Byte, sondern eben immer nur auf... weil die die Zugriffen eine gewisse Busbreite haben.
00:47:56: Und typische Speichermodule hat der pfiehnsächtig Datenleitung.
00:48:00: Das sind also acht Bytes schon mal gesetzt und bei Double Data Rate ist die Adressierung eben dass man gleich ein längeres Datenpaket liest oder schreibt und eben diese pfiedsächtige Bytes in einem pfiendsächte Bit-Speicherkanal eben acht Pakete, die dann in diesen vier Zyklen über den Bus gehen Und in diesem Raster laufen eben diese ganzen Zugriffen, und dadurch ergibt sich das automatisch wie groß dann so eine Keschlein ist.
00:48:24: Okay,
00:48:24: d.h.,
00:48:25: also das ist nicht irgendwie zufällig gewählt oder immer unterschiedlich sondern die ganze Speicherherarchie orientiert sich sozusagen an der Adressierung.
00:48:34: Also letztendlich geht man natürlich... Es war uns früher mal jetzt... Die Zweiunddreißig-Bitwelt, da folgt mir die Sechzehn-Bittwelt und so, und so ist dann natürlich irgendwie in einer gewissen Logik auch der Speicher Strukturiert von dem ganzen Aufbau.
00:48:50: Das heißt also bei Cashes kann man sagen geht es immer nur um Cache Lines, nicht um einzelne Daten sondern in diesem Häppchen wird der Cash verwaltet.
00:49:01: Es gibt aber auch Sinn weil die Daten mit denen gerechnet werden sind ja am gewissen Größe viel größer nach den Regeln und es ist selten dass man wirklich mal auf ein Bitt zugreifen muss.
00:49:11: aus Prozessersicht.
00:49:13: Ist ja bei Festplatten auch so ich kann ja nicht bei einer Festplatte einen Ein bitt irgendwo lesen, sondern ich muss halt immer diese was weiß ich vier kilobytes
00:49:21: Sektor
00:49:23: lesen und deswegen ist ja auch die IOPS mit VK sektoren und sowas.
00:49:28: also diese ganzen sachen hängen miteinander zusammen und fallen nicht irgendwie vom himmel.
00:49:31: das ist ja man kann noch acht ka IOPS messen.
00:49:34: Also kann man auch der
00:49:35: ist einfach um normal verwaltungssache.
00:49:38: wenn ich jetzt ein bitte adressieren würden können würde müsste ich ja irgendwo information haben.
00:49:44: Koordinatensystem, jetzt mal ganz einfach gesagt egal welches Medium es ist wo es liegt und das hat ein Riesenaufwand Pro Ein-Bit dann habe ich ja mehr Metadaten als das eine Bit.
00:49:53: Klar muss man einfach in Blöcke irgendwie unterteilen oder Lines oder was auch immer.
00:50:00: Gut Ich würde sagen wir machen mal Schluss.
00:50:03: Man könnte Jetzt noch die Optimierungsstrategien analysieren und so soweit sie überhaupt offengelegt sind.
00:50:10: Es gibt aber Ja Auch sehr viele Fachvorträge und Sowas Die sich über sowas Auslastet.
00:50:15: also man kann da so pauschal.
00:50:17: ich glaube was man pauschale sagen kann haben wir pauschall gesagt.
00:50:21: Es gibt wahnsinnig viele.
00:50:24: Also cash ist ein sehr starkes Instrument um die performance zu steigern und da gibt es natürlich wahnsinnige.
00:50:30: Viele ideen, was man noch noch auch noch toller machen könnte.
00:50:34: Aber das große problem isst was für das eine zugrufsmuster super ist.
00:50:38: pass bringt bei dem anderen vielleicht ganz wenig.
00:50:40: deswegen ist es sehr kommt es sehr auf Optimierung für die jeweilige Plattform an.
00:50:46: Das ist eigentlich das, glaube ich was man so mitnehmen kann wenn man mal abstrahiert von den ganzen verwirrenden Leveln und Lines und TLBs usw.
00:50:58: Christian vielen herzlichen Dank fürs Gespräch.
00:51:01: Danke schön!
00:51:01: Vor
00:51:03: allem danken wir aber ihnen liebe Zuhörerinnen und Zuhörer für ihr Interesse und ihr Zuschalten.
00:51:09: Wir freuen uns über Feedback, gerne per Mail an bit-rauschenetct.de.
00:51:17: Wenn Sie jetzt immer noch mehr Lust auf Podcasts haben dann wissen sie aber als häufige Hörer finden Sie ganz viel Auswahl unter heise.de-podcast.
00:51:29: Ganz zum Schluss danken wir unserem Producer Ralf Und sagen Tschüss und bis zur nächsten Folge von Betrauschen.
00:51:37: Jeden zweiten Mittwoch ganz früh einmal!
Neuer Kommentar