- Google razvija »TorchTPU«, da bi bili njegovi čipi umetne inteligence popolnoma združljivi s PyTorchom in olajšali migracijo z grafičnih procesorjev Nvidia.
- Namen te poteze je spremeniti TPU-je v splošno alternativo v oblaku in na lokaciji, s čimer se zmanjša odvisnost od Nvidijinega ekosistema CUDA.
- Google tesno sodeluje z Meto, skrbnikom PyTorcha, in razmišlja o odprtokodni različici delov sklada, da bi pospešil njihovo uporabo.
- Močnejša podpora za PyTorch bi lahko zmanjšala stroške in tehnične ovire za podjetja, ki želijo diverzificirati svojo infrastrukturo umetne inteligence.
Google tiho preoblikuje svojo strategijo v tekmi za umetno inteligenco . Po nekaj letih osredotočanja na lastne oznake znotraj podjetja se podjetje zdaj resno zavzema za to, da bi njegovi čipi umetne inteligence brezhibno delovali s PyTorchom, odprtokodnim kompletom orodij, ki je postal privzeta izbira za večino razvijalcev umetne inteligence po vsem svetu.
V središču te spremembe je projekt, interno znan kot »TorchTPU« , katerega namen je zapolniti vrzel med tem, kako je zgrajena Googlova strojna oprema, in tem, kako stranke dejansko gradijo svoje sisteme umetne inteligence. Z dvigom podpore za PyTorch na prvovrstni nivo na svojih tenzorskih procesnih enotah (TPU) želi Google zmanjšati ogromno prednost, ki jo je Nvidia zgradila s svojim ekosistemom programske opreme CUDA.
Google spreminja TPU-je v resnega tekmeca za Nvidijine grafične procesorje
Googlovi TPU-ji so že dolgo veljali za visokozmogljive čipe, prilagojene delovnim obremenitvam umetne inteligence , vendar se niso kosali z vseprisotnostjo Nvidijinih grafičnih procesorjev. Eden ključnih razlogov je, da je Nvidia leta zagotavljala, da PyTorch na svoji strojni opremi deluje izjemno dobro, medtem ko se je Google osredotočal predvsem na lastna orodja in interne delovne procese.
Znotraj podjetja Alphabet so TPU-ji postali ključni dejavnik rasti za Google Cloud . Prodaja dostopa do teh čipov prek svoje platforme v oblaku je zdaj osrednji del načina, kako Google želi vlagateljem dokazati, da se lahko njegove naložbe v umetno inteligenco pretvorijo v oprijemljive prihodke, ne le v raziskovalni prestiž ali eksperimentalne izdelke.
Vendar pa strojna oprema sama po sebi ne prepriča razvijalcev. Podjetja, ki razmišljajo o TPU-jih, so Googlu večkrat povedala, da je združljivost programske opreme težavna točka : ekipe, ki so močno standardizirale PyTorch, ne želijo preoblikovati svoje kode ali prekvalificirati osebja samo zato, da bi preizkusile nov čip.
Tukaj pride na vrsto TorchTPU. Namen pobude je, da bi se z vidika razvijalca zdelo, da so TPU-ji tako enostavni za uporabo s PyTorchom, kot so danes grafični procesorji Nvidia . Cilj je, da se lahko obstoječi modeli in cevovodi PyTorcha prenesejo z minimalnimi spremembami, s čimer se stroški in tveganje eksperimentiranja s TPU-ji močno zmanjšajo.
Tiskovni predstavnik Google Clouda se je sicer izognil tehničnim podrobnostim, vendar je potrdil, da je glavni cilj strankam zagotoviti veliko večjo fleksibilnost pri izvajanju delovnih obremenitev umetne inteligence , ne glede na to, katero strojno opremo izberejo.
Kaj TorchTPU resnično spremeni za razvijalce PyTorcha
PyTorch, ki ga je prvotno ustvarila in promovirala Meta, je postal dejanski standardni okvir za gradnjo sodobnih sistemov umetne inteligence . Večina inženirjev v Silicijevi dolini in drugod ne kodira ročno jeder za čipe Nvidia, AMD ali Google; namesto tega se zanašajo na PyTorch in podobne okvire, ki zagotavljajo plasti vnaprej izdelanih komponent in pripomočkov za učenje.
Rast PyTorcha je bila od izida leta 2016 tesno povezana s CUDA in njegovimi sorodnimi knjižnicami , programskim paketom, ki ga mnogi analitiki z Wall Streeta smatrajo za najpomembnejše strateško sredstvo Nvidie. Nvidijini inženirji so veliko investirali v to, da bi zagotovili, da PyTorch deluje z največjo učinkovitostjo na njihovih grafičnih procesorjih, zaradi česar je ta kombinacija privzeta izbira za učenje in uvajanje obsežnih modelov umetne inteligence.
Google je v nasprotju s tem leta podpiral Jax , še en programski okvir, ki ga je imel rad zlasti znotraj lastnih raziskovalnih in produktnih ekip. TPU-ji so se za učinkovito izvajanje kode, ki temelji na Jaxu, zanašali na plast prevajalnika, imenovano XLA , in velik del Googlovega notranjega sklada programske opreme za umetno inteligenco in optimizacij delovanja je bil zgrajen okoli te kombinacije.
Posledica tega je vse večje neskladje med tem, kako Google sam uporablja svoje čipe , in tem, kako večina zunanjih strank raje dela. Številna podjetja so se skoraj v celoti standardizirala na PyTorchu, kar pomeni, da je prehod na TPU-je običajno pomenil prelomno spremembo v orodjih, kodi in razvijalskih veščinah.
S TorchTPU poskuša Google odpraviti to trenje. Cilj projekta je zagotoviti polno podporo za PyTorch na TPU-jih , tako da se lahko podjetja še naprej zanašajo na znane knjižnice, učne zanke in vzorce uvajanja, hkrati pa spreminjajo le osnovno strojno opremo. To bi lahko močno zmanjšalo tako inženirski napor kot krivuljo učenja za ekipe, ki želijo oceniti delovanje ali stroškovne prednosti TPU-jev.
Več virov, odprtokodna programska oprema in večja zavezanost
Po besedah ljudi, ki so seznanjeni s pobudo, TorchTPU ni le še en stranski eksperiment. Za razliko od nekaterih prejšnjih poskusov, da bi PyTorch deloval na TPU-jih, je Google temu prizadevanju zdaj namenil večjo organizacijsko pozornost, proračun in strateški pomen ter ga obravnava kot osrednji steber svojega načrta za infrastrukturo umetne inteligence in ne kot nišni projekt združljivosti.
Eden najpomembnejših elementov, ki jih je treba upoštevati, so odprtokodni deli programskega sklada TorchTPU. Z izdajo ključnih komponent skupnosti Google upa, da bo pospešil sprejetje, pritegnil zunanje sodelavce in zgradil zaupanje med velikimi strankami, ki si želijo preglednosti in dolgoročne stabilnosti na svojih platformah umetne inteligence.
Ta bolj odprt odnos je namenjen tudi pomirjanju podjetij, ki so menila, da je podpora za TPU preveč tesno povezana z Googlovim internim načinom dela. Če bi zunanjim razvijalcem omogočili pregled, razširitev in odpravljanje napak v komponentah TorchTPU, bi se TPU-ji lahko manj počutili kot lastniški otok in bolj kot prvovrstni državljani v širšem ekosistemu PyTorch.
Za podjetja je to pomembno v praksi. Če bo TorchTPU uspešen, bi lahko znatno znižal stroške migracije z grafičnih procesorjev Nvidia na Google TPU-je , kar bi omogočilo diverzifikacijo računalniške infrastrukture brez večletnega prepisovanja programske opreme.
Stranke so Googlu večkrat povedale, da je bila zgodovinska zahteva po prehodu na Jax glavni odvračilni dejavnik. PyTorch že prevladuje med razvijalci umetne inteligence, na hitro spreminjajočih se trgih pa je le malo organizacij pripravljenih začasno ustaviti razvoj izdelkov, medtem ko se njihove ekipe preoblikujejo v nov okvir samo zato, da bi dostopale do alternativne strojne opreme.
Od interne strojne opreme do široke ponudbe za podjetja
Dolgo časa je Alphabet večino svojih zmogljivosti TPU-jev hranil za interno uporabo znotraj Googla , kar je omogočalo iskanje, prevajanje, sisteme priporočil in zgodnje raziskave umetne inteligence. To stališče se je začelo spreminjati leta 2022, ko je oddelek za računalništvo v oblaku dobil večja pooblastila glede proizvodnje in prodaje TPU-jev.
Od takrat se je razpoložljivost TPU-jev prek storitve Google Cloud znatno povečala . Ker se je zanimanje podjetij za umetno inteligenco povečalo, je Google svoje čipe pozicioniral kot način, s katerim lahko stranke izkoristijo vrhunsko računalništvo, ne da bi morale upravljati lastne tesno povezane grozde grafičnih procesorjev.
Pred kratkim je Google šel še korak dlje in začel prodajati TPU-je neposredno za namestitev v lastne podatkovne centre strank , ne le prek javnega oblaka. Ta premik omogoča večjim organizacijam s strogimi regulativnimi zahtevami ali zahtevami glede zakasnitve, da integrirajo TPU-je v svojo lokalno infrastrukturo, hkrati pa še vedno izkoristijo prednosti Googlovega načrta za strojno opremo.
Ta širitev preoblikuje tudi notranje prioritete Googla. Podjetje potrebuje zmogljivosti TPU tako za zagon lastnih izdelkov umetne inteligence – od klepetalnega robota Gemini do funkcij iskanja, ki jih poganja umetna inteligenca – kot za storitve za zunanje stranke Google Cloud, vključno z znanimi podjetji za umetno inteligenco, kot je Anthropic, ki se zanašajo na najete zmogljivosti TPU.
Za usklajevanje vsega tega je Google dvignil vodstvo infrastrukture umetne inteligence: dolgoletni izvršni direktor Amin Vahdat je bil imenovan za vodjo infrastrukture umetne inteligence in zdaj neposredno poroča izvršnemu direktorju Sundarju Pichaiju . Ta linija poročanja poudarja, kako osrednjega pomena je postal strojna in programska oprema za širše ambicije Googla na področju umetne inteligence.
Partnerstvo z Meto za okrepitev PyTorcha na TPU-jih
Google ne načrtuje samega projekta TorchTPU. Po navedbah ljudi, ki poznajo pogovore, podjetje tesno sodeluje z Meto, ustvarjalcem in skrbnikom PyTorcha , da bi pospešili podporo za TPU-je in uskladili tehnične smernice, ki koristijo obema partnerjema.
Pogovori med podjetji vključujejo dogovore, ki bi Meta omogočili dostop do večje zmogljivosti TPU . Prejšnji predlogi so to domnevno opredelili kot upravljane storitve: Google bi svoje čipe namestil v okolja, kjer bi Meta lahko izvajala lastno programsko opremo in modele, Google pa bi poskrbel za večino operativnih stroškov.
Za Meto je strateško pomembno, da PyTorch deluje učinkovito na širšem naboru strojne opreme. Podjetje ima jasno spodbudo za zmanjšanje stroškov sklepanja in diverzifikacijo od izključne odvisnosti od grafičnih procesorjev Nvidia , tako za zmanjšanje lastnih izdatkov kot za okrepitev pogajalskega položaja pri pogajanjih o prihodnjih nakupih čipov.
S sodelovanjem z Googlom lahko Meta pomaga zagotoviti, da PyTorch ostane neodvisen od strojne opreme in široko optimiziran , namesto da bi ga dojemali kot tesno vezanega na ekosistem enega samega prodajalca. To pa krepi status PyTorcha kot standarda skupnosti in ohranja ogrodje privlačno tako za raziskovalce kot za podjetja.
Meta se zaenkrat ni želela javno izpostaviti teh konkretnih dogovorov, vendar je usklajenost interesov jasna : velikan družbenih medijev in umetne inteligence si želi možnosti, ki presegajo Nvidio, medtem ko Google želi, da bi se PyTorch na njihovih TPU-jih zdel izvorni, da bi ga bilo več strank pripravljenih preizkusiti.
Zmanjševanje prednosti Nvidie pri CUDA
Nvidijina prevlada na področju umetne inteligence ni le v dobavi zmogljivih grafičnih procesorjev. V mnogih letih je podjetje zgradilo obsežen programski sklad – zasidran na – ki je globoko integriran v ogrodja, kot je PyTorch. Ta kombinacija strojne in programske opreme je postala privzeta platforma za učenje in sklepanje za najsodobnejše modele umetne inteligence.
Zaradi te tesne integracije se mnogim organizacijam zdi opustitev Nvidie tvegana in draga . Kodne baze, delovni procesi in strokovno znanje osebja so uglašeni za CUDA, zaradi česar so alternativni čipi videti kot potencialni vir trenja, tudi če na papirju obljubljajo boljše cene ali zmogljivost.
Googlov projekt TorchTPU je neposreden poskus, da bi to prednost spodkopal. Če lahko PyTorch deluje na TPU-jih s podobno stopnjo enostavnosti in optimizacije zmogljivosti kot na grafičnih procesorjih Nvidia, podjetja pridobijo verodostojno alternativo za velike delovne obremenitve umetne inteligence . Na trgu, kjer povpraševanje po računanju z umetno inteligenco eksplodira in so omejitve ponudbe pogoste, bi lahko bila še ena resna možnost zelo privlačna.
Hkrati pa Googlova odločitev, da bo razmislil o odprtokodni različici ključnih delov paketa TorchTPU, kaže na drugačen pristop od Nvidijinega bolj vertikalno integriranega sloga. Z deljenjem večje količine osnovne programske opreme si Google prizadeva vzpostaviti zaupanje med razvijalci, ki cenijo preglednost in prenosljivost.
Nič od tega ne zagotavlja, da bodo TPU-ji nadomestili grafične procesorje, vendar spreminja računico. Namesto da bi izbirali med Nvidijinim zrelim ekosistemom in alternativo, ki zahteva popolno migracijo orodij, bi lahko stranke tehtale zmogljivost, stroške in razpoložljivost, hkrati pa ostale v znanem okolju PyTorch.
V oblaku in na lokaciji bi ta premik lahko organizacijam olajšal kombiniranje ponudnikov strojne opreme skozi čas, namesto da bi svoje načrte za umetno inteligenco privzeto vezale na enega samega prodajalca.
Ker Google poglablja svojo zavezanost PyTorchu prek TorchTPU, povečuje dostop podjetij do TPU-jev in tesnejši sodelovanje z Meto, postaja konkurenčno okolje okoli infrastrukture umetne inteligence vse bolj spremenljivo. Nvidijina prednost, ki temelji na letih strojne opreme in integracije CUDA, je še vedno precejšnja, vendar stranke zdaj vidijo bolj realistične poti do diverzifikacije, kje se izvajajo njihove delovne obremenitve umetne inteligence in koliko plačujejo za osnovno računanje.
