Scott Wu från Cognition säger att AI-kodningsagenter inte bör ersätta människor ↗
Cognitions Scott Wu motsatte sig idén att Devin är byggt för att helt ersätta programmerare. En något tafatt hållning, med tanke på att företaget också säger att Devin använder en stor del av sin egen kod.
Hans formulering är mer "AI-kodningskompis" än "ditt jobb har blivit uppätet av en laptop-goblin". Ändå är spänningen svår att missa - bättre agenter, färre ursäkter för uppsvällda ingenjörsteam ... eller så lyder argumentet.
Denna AI-startup kommer att städa ditt hem gratis för att träna framtida robotar ↗
Shift erbjuder gratis städning i hemmet, med en hake som är både praktisk och lätt oroande: städare bär en kamerautrustad "magisk hatt" så att företaget kan samla in data om robotträning.
Erbjudandet är enkelt – du får en ren lägenhet, de får video av hushållssysslor. Ett snyggt fynd, kanske.
Shift säger att det suddar ut känsliga detaljer och anonymiserar bilder, men den bredare frågan ligger fortfarande där som en strumpa under soffan: hur mycket hemintegritet är folk villiga att byta ut för bekvämlighet?
Antropiska utgåvor Claude Opus 4.8 ↗
Anthropic lanserade Claude Opus 4.8 med uppgraderingar inom kodning, agentiska arbetsflöden, resonemang och professionellt arbete. Den stora fördelen är tillförlitlighet - färre ogrundade påståenden, bättre verktygsanvändning och mer självkontroll.
Claude Code får också dynamiska arbetsflöden, vilket låter modellen planera, starta parallella underagenter, verifiera utdata och rapportera tillbaka. Det låter torrt tills man inser att det i princip är projektledning i trenchcoat.
Prissättningen förblir uppdelad mellan standard- och snabblägen, där Anthropic lutar sig hårdare mot ansträngningskontroller så att användare kan kompromissa med hastighet, kvalitet och tokenförbränning.
Foxconn har enormt förtroende för tillväxtmomentum tack vare AI, säger ordförande ↗
Foxconns ordförande sa att efterfrågan på AI förändrar företagets vanliga säsongsrytm. Den gamla leverantörsnedgången mitt i året? Tydligen beter sig den inte normalt längre.
Anledningen är molnjättarnas gigantiska AI-utgifter, vilket Foxconn ser som sin egen marknadsmöjlighet. Det är hårdvarusidan av AI-boomen, mindre glansig än chatbots, men i hög grad där pengarna klingar.
Foxconn är redan en stor tillverkare av Nvidia-serverringar, så deras optimism är i grunden en temperaturkontroll av AI-infrastrukturkapplöpningen.
En gemensam handbok för pålitliga tredjepartsutvärderingar ↗
OpenAI publicerade riktlinjer för AI-utvärderingar från tredje part och menade att tester behöver tydligare detaljer om vad som utvärderades, hur det testades och vad resultaten kan bevisa.
Kärnpoängen är förvånansvärt praktisk: utvärderingar av AI i frontlinjen kan inte bara vara gissningar i form av topplistor. Utvärderare måste förklara det testade systemet, instruktioner, säkerhetsåtgärder, giltighetskontroller och var påståenden slutar.
Det spelar roll eftersom i takt med att modeller blir mer agentiska kan ytliga tester få system att se säkrare eller starkare ut än de är. Litet pappersarbete, energi, stora konsekvenser.
Vanliga frågor
Är AI-kodningsagenter som Devin avsedda att ersätta programmerare?
Scott Wu framställer AI-kodningsagenter som kodningspartners snarare än fullständiga ersättare för mänskliga programmerare. Artikeln pekar dock på en spänning: Devin beskrivs också som bidragande med en stor del av Cognitions egen kod. I praktiken är slutsatsen att dessa verktyg kan minska en del av det rutinmässiga ingenjörsarbetet samtidigt som de fortfarande är beroende av människor för bedömning, vägledning och ansvarsskyldighet.
Varför erbjuder Shift gratis hemstädning för AI-träningsdata?
Shift erbjuder gratis städning eftersom de vill ha fysiska videodata från hushållssysslor för att träna framtida robotar. Städare bär en kamerautrustad "magisk hatt" medan de arbetar och producerar filmmaterial som kan hjälpa AI-system att förstå hushållssysslor. Utbytet är tydligt: kunderna får ett rent hem, medan företaget får data från privata bostadsutrymmen.
Hur hanterar Shift integritet när de samlar in bilder från städning?
Artikeln säger att Shift hävdar att det suddar ut känsliga detaljer och anonymiserar filmklipp. Det kan minska vissa integritetsrisker, men det tar inte bort den bredare oron med att spela in i människors hem. För användarna är den centrala frågan om bekvämligheten med gratis städning känns värd den nivån av datainsamling.
Vad är nytt i Claude Opus 4.8?
Claude Opus 4.8 beskrivs som förbättrad kodning, agentiska arbetsflöden, resonemang och professionellt arbete. Uppdateringen fokuserar på tillförlitlighet, inklusive färre ogrundade påståenden, starkare verktygsanvändning och mer självkontroll. Claude Code får också dynamiska arbetsflöden, där modellen kan planera, köra parallella underagenter, verifiera utdata och rapportera resultat.
Varför spelar Foxconns optimism kring AI-boomen roll?
Foxconns förtroende är viktigt eftersom det återspeglar hårdvarusidan av AI-boomen. Företagets ordförande sa att AI-efterfrågan förändras sitt vanliga säsongsmönster, där molnjättarnas infrastrukturinvesteringar skapar en stor marknadsmöjlighet. Eftersom Foxconn redan är en stor tillverkare av Nvidia-serverar fungerar deras kommentarer som en stark signal för efterfrågan på AI-infrastruktur.
Vad säger OpenAI att utvärderingar av tredjeparts AI är trovärdiga?
OpenAI menar att AI-utvärderingar behöver tydligare förklaringar av vilket system som testades, hur det testades och vad resultaten verkligen visar. Det inkluderar detaljer om uppmaningar, skyddsåtgärder, giltighetskontroller och begränsningar för eventuella påståenden. Poängen är särskilt viktig för mer agentiska modeller, där ytliga tester kan få system att verka säkrare eller mer kapabla än de är.