
GLM-5.3 on Z.ai uusim mudel, mis on loodud keerukate ja pikaajaliste kodeerimisĂŒlesannete jaoks. TĂ€nu ulatuslikule jĂ€reltreenimise skaleerimisele saavutab see avatud lĂ€htekoodiga tipptaseme agentipĂ”hises kodeerimises ning nĂ€itab esilekerkivaid vĂ”imeid haavatavuste avastamisel ja kĂŒberkaitse valdkonnas.
Loading commentsâŠ
Projekti info
Toote mÀrksÔnad
GLM-5.3 on Z.ai uusim tipptasemel mudel, mis on loodud spetsiaalselt keerukate, pikaajaliste kodeerimis- ja agentĂŒlesannete jaoks. See jagab sama alusmudelit oma eelkĂ€ijaga GLM-5.2 â kĂ”ik tĂ€iustused tulenevad ulatuslikust jĂ€reltreeningu skaleerimisest, mitte arhitektuurimuudatustest. Tulemuseks on avatud lĂ€htekoodiga tipptase agentkodeerimises, lisaks esilekerkivad vĂ”imed haavatavuste avastamisel ja kĂŒberkaitses, mida treeningu kĂ€igus otseselt ei sihitud.
GLM-5.3 kasv tuleneb tĂ€ielikult jĂ€reltreeningu skaleerimisest GLM-5.2 jaoks ehitatud virnal: IndexShare tĂ”husaks pika konteksti töötlemiseks, SAO pikaajaliste ĂŒlesannete tugevdusĂ”ppeks ja slime suuremahuliseks asĂŒnkroonseks treeninguks. Viimase kuu jooksul skaleeris Z.ai keskkondi, ĂŒlesannete mitmekesisust ja arvutusvĂ”imsust â ilma alusmudelit muutmata.
Et skaleerida kĂ€sitsi ehitatud etalonidest kaugemale, ehitas Z.ai torustikud, mis sĂŒnteesivad otsast lĂ”puni kĂ€ivitatavaid ja kontrollitavaid keskkondi. Teadusagentid koguvad ĂŒlesandemustreid reaalsest tööst ja muudavad need pikaajalisteks keskkondadeks, millel on mitmeastmelised sĂ”ltuvused ja varjatud olek. Kohtunik-agent kontrollib lahendatavust ja kontrollijad sĂŒnteesitakse ilma referentslahendustele juurdepÀÀsuta, sulgedes tasu lĂŒhiradade.
Treening lĂ€bi tootmislaadsete töövoogude andis GLM-5.3-le ootamatuid tugevusi haavatavuste avastamisel ja kĂŒberkaitses. See saavutab CyberGymis 84,5 ja ExploitBenchis 54,4 â mĂ€rkimisvÀÀrne hĂŒpe vĂ”rreldes GLM-5.2 29/39-ga ExploitGymi 2h/6h ĂŒlesannetes â nĂ€idates, et jĂ€reltreeningu skaleerimine mitmekesise eksperditöö peal vĂ”ib avada vĂ”imeid, mis ĂŒletavad algseid treeningueesmĂ€rke.
SAO strateegia koos tihendamisega kandub ĂŒle GLM-5.2-st, aidates kasul saavutustel pĂŒsida pikendatud ĂŒlesannetes, mitte hÀÀbuda lĂŒhikestes. Parandus on dramaatiline: Terminal-Bench 3.0 hĂŒppas 4,6-lt 28,3-le ja DeepSWE v1.1 tĂ”usis 46,2-lt 66,9-le.
GLM-5.3 tĂ”estab, et ainult jĂ€reltreeningu skaleerimine â mitte arhitektuur â on uus piir agentkodeerimises ja kĂŒbervĂ”imetes.
See on seni tugevaim avatud lĂ€htekoodiga tulemus agentkodeerimise etalonides ja kĂŒberalased tulemused on tĂ”eliselt ĂŒllatavad. SĂŒnteesitud keskkonna torustik on samuti suur infrastruktuurisaavutus: see nihutab kitsaskoha mudeli vĂ”imekuselt keskkonna genereerimisele ja Z.ai töötab juba selle protsessi automatiseerimise nimel. Meeskondadele, kes vajavad avatud mudelit, mis suudab vĂ”tta enda kanda mĂ€rkimisvÀÀrse töö otsast lĂ”puni, on GLM-5.3 praegu etalon, mida ĂŒletada.
Ehitate agentkodeerimise tööriistu, turbeuuringu töövooge vĂ”i pikaajalist automatiseerimist, mis vajab mudelit, mis suudab tĂ”eliselt vastutada ĂŒlesannete eest. Kui olete oodanud avatud mudelit, mis lĂ€heneb suletud tipptasemel mudelitele keerukas kodeerimises ja kĂŒberalases töös, siis GLM-5.3 vÀÀrib tĂ”sist hindamist.
Teised tööriistad, mida vÔiksid kaaluda
Bob's CLI töötab sinu enda riistvaral, ilma API-kuludeta ja andmed ei lahku sinu masinast. Bob elab sinu terminalis, nĂ€eb sinu tegelikke faile ja kirjutab koodi ainult sinu selgesĂ”nalise loaga. Mis teeb selle eriliseks: kohalike AI-mudelite automaatne tuvastamine, kĂ€itumuslik DNA-profiil, mis kohandub SINU tööstiiliga, autonoomne koodiĂŒlevaatus + automaatparandus, vestluse hargnemine, sĂŒvitsi sukeldumised ja SovereignLink â kaugtĂ€itmine igast seadmest, samal ajal kui sinu kood jÀÀb koju. Tasuta alustamiseks. SuverÀÀnne disainilt.
GitHits annab kodeerimisagentidele juurdepÀÀsu avatud lĂ€htekoodiga, millest teie rakendus sĂ”ltub. Hankige reaalseid teostusnĂ€iteid, sĂ”ltuvuste lĂ€htekoodi sirvimist, pakettide kontrollimist ja dokumentatsiooni. Agendid saavad teie koodibaasi otsida ja lugeda. Nad ei saa otsida ega lugeda avatud lĂ€htekoodi, millest teie rakendus sĂ”ltub. Siit algab nende oletamine, uuesti proovimine ja tsĂŒklisse jÀÀmine. GitHits ehitab nĂ”udmisel versiooniteadliku indeksi. Agendid saavad otsida, sirvida ja kontrollida oma sĂ”ltuvuste taga olevat koodi. CLI: npx githits@latest init
Enamik agente lÀbib oma testid, kuid ebaÔnnestub tootmises. Prefactor on hindamiskiht, mis selle lÔhe sulgeb. Me hindame iga agendi kÀivitust reaalajas, toome esile kvaliteedilangused ja triivid nende tekkimise hetkel ning nÀitame insenerimeeskondadele tÀpselt, kuidas nende agendid suurel skaalal toimivad. Loodud meeskondadele, kes saadavad agente klientidele.
Harness Starter Kit aitab meeskondadel muuta haprad AI-koodimise kÀsud vastupidavateks repositooriumireegliteks: AGENTS.md, triivi kontrollid, tÔrkemÀlu, kasutuselevÔtu aruanded ja tehnoloogiaprofiilid turvalisemaks agendikoostööks.
Looja
blueprint_b
Alternatiivid
Loading commentsâŠ