Скот Ву от Cognition казва, че кодиращите агенти с изкуствен интелект не трябва да заместват хората ↗
Скот Ву от Cognition отхвърли идеята, че Devin е създаден, за да замени програмистите изцяло. Малко неловка позиция, като се има предвид, че компанията също така твърди, че Devin използва огромен дял от собствения си код.
Неговата формулировка е по-скоро „приятел за кодиране на изкуствен интелект“, отколкото „работата ти е изядена от лаптоп гоблин“. И все пак напрежението е трудно да се пропусне - по-добри агенти, по-малко извинения за раздути инженерни екипи... или поне така се твърди.
Този стартъп с изкуствен интелект ще почиства дома ви безплатно, за да обучава бъдещи роботи ↗
Shift предлага безплатно почистване на дома, с уловка, която е едновременно удобна и леко обезпокоителна: чистачите носят „магическа шапка“, оборудвана с камера, за да може компанията да събира данни за обучение на роботи.
Идеята е проста - вие получавате чист апартамент, те получават видеозапис на домакинската работа. Може би добра сделка.
Shift казва, че размива чувствителни детайли и анонимизира кадрите, но по-широкият въпрос все още стои като чорап под дивана: доколко от личния живот на хората са готови да заменят удобството?
Anthropic издава Claude Opus 4.8 ↗
Anthropic пуснаха Claude Opus 4.8 с подобрения в кодирането, агентните работни процеси, разсъжденията и професионалната работа. Най-голямото предимство е надеждността - по-малко неподкрепени твърдения, по-добро използване на инструментите и повече самоконтрол.
Клод Код също така получава динамични работни потоци, позволявайки на модела да планира, да задейства паралелни подагенти, да проверява резултатите и да докладва. Това звучи сухо, докато не осъзнаете, че е основно управление на проекти в тренчкот.
Ценообразуването остава разделено между стандартен и бърз режим, като Anthropic се насочва повече към контрол на усилията, така че потребителите да могат да правят компромис между скорост, качество и изгаряне на токени.
Foxconn има огромна увереност в инерцията на растежа благодарение на изкуствения интелект, казва председателят ↗
Председателят на Foxconn заяви, че търсенето на изкуствен интелект променя обичайния сезонен ритъм на компанията. Старият спад на доставчиците в средата на годината? Очевидно вече не се държи нормално.
Причината са гигантските разходи на облачните гиганти за изкуствен интелект, които Foxconn вижда като своя пазарна възможност. Това е хардуерната страна на бума на изкуствения интелект, по-малко лъскава от чатботовете, но до голяма степен мястото, където парите тлеят.
Foxconn вече е основен производител на сървъри за Nvidia, така че оптимизмът им е по същество проверка на температурата в надпреварата за инфраструктура с изкуствен интелект.
Споделен наръчник за надеждни оценки от трети страни ↗
OpenAI публикува насоки за оценки на ИИ от трети страни, като твърди, че тестовете се нуждаят от по-ясни подробности за това какво е било оценено, как е било тествано и какво могат да докажат резултатите.
Основният момент е изненадващо практичен: оценките на граничния ИИ не могат да бъдат просто догадки във формата на класация. Оценителите трябва да обяснят тестваната система, подканите, предпазните мерки, проверките за валидност и къде спират твърденията.
Това е важно, защото с нарастването на агентивността на моделите, повърхностните тестове могат да накарат системите да изглеждат по-безопасни или по-силни, отколкото са в действителност. Малка енергия за документооборот, големи последици.
ЧЗВ
Предназначени ли са агенти за кодиране с изкуствен интелект като Девин да заменят програмистите?
Скот Ву определя агентите за кодиране с изкуствен интелект като партньори по кодиране, а не като пълноценни заместители на човешките програмисти. Статията обаче посочва противоречие: Девин е описан и като допринасящ с голям дял от собствения код на Cognition. На практика изводът е, че тези инструменти могат да намалят част от рутинната инженерна работа, като същевременно все още зависят от хората за преценка, насока и отчетност.
Защо Shift предлага безплатно почистване на дома за данни за обучение на изкуствен интелект?
Shift предлага безплатно почистване на дома, защото иска видео данни от физическия свят за домакинска работа, за да обучава бъдещи роботи. Чистачите носят „магическа шапка“, оборудвана с камера, докато работят, създавайки кадри, които могат да помогнат на системите с изкуствен интелект да разберат домакинските задачи. Размяната е ясна: клиентите получават чист дом, докато компанията получава данни от частни жилищни пространства.
Как Shift се грижи за поверителността при събирането на кадри от почистване на дома?
В статията се казва, че Shift твърди, че размива чувствителни детайли и анонимизира кадрите. Това може да намали някои рискове за поверителността, но не премахва по-широкия проблем със записването в домовете на хората. За потребителите основният въпрос е дали удобството на безплатното почистване си струва това ниво на събиране на данни.
Какво е новото в Claude Opus 4.8?
Claude Opus 4.8 е описан като подобрение в кодирането, агентните работни процеси, разсъжденията и професионалната работа. Актуализацията се фокусира върху надеждността, включително по-малко неподкрепени твърдения, по-силно използване на инструменти и повече самоконтрол. Claude Code също така получава динамични работни процеси, при които моделът може да планира, да изпълнява паралелни подагенти, да проверява изходите и да докладва резултати.
Защо оптимизмът на Foxconn относно бума на изкуствения интелект е важен?
Увереността на Foxconn е важна, защото отразява хардуерната страна на бума на изкуствения интелект. Председателят на компанията заяви, че търсенето на изкуствен интелект променя обичайния си сезонен модел, като разходите за инфраструктура на облачните гиганти създават голяма пазарна възможност. Тъй като Foxconn вече е основен производител на сървъри на Nvidia, коментарите на компанията служат като силен сигнал за търсене на инфраструктура с изкуствен интелект.
Какво според OpenAI прави оценките на ИИ от трети страни надеждни?
OpenAI твърди, че оценките на ИИ се нуждаят от по-ясни обяснения за това каква система е била тествана, как е била тествана и какво реално показват резултатите. Това включва подробности за подкани, предпазни мерки, проверки за валидност и ограничения на евентуални твърдения. Този момент е особено важен за по-агентните модели, където повърхностните тестове могат да направят системите да изглеждат по-безопасни или по-способни, отколкото са в действителност.