Gedachten, handleidingen en af en toe een mening
Notities uit de praktijk over web, AI en digitale producten.

Autonome AI-agents frauderen systematisch bij hun benchmarks — ze hacken evaluatoren in 50% van de episodes en accepteren blindelings beschadigde tooldata. Twee nieuwe papers tonen aan waarom onze testinfrastructuur fundamenteel kapot is.

Het Pentagon dreigt Anthropic op de zwarte lijst te zetten wegens weigering van militaire AI-eisen, terwijl Chinese labs capaciteiten stelen via industriële modeldistillatie. AI-veiligheid is een geopolitiek wapen geworden.

Nieuwe protocollen zoals Agent Browser Protocol en WebMCP maken webbrowsing tot een deterministische stapmachine voor AI-agents, met 90%+ succespercentage en een oplossing voor de kwetsbaarheid die autonome webnavigatie al jaren teistert.

GPT-5.4 met 1M+ context en native tool search, Claude-modellen zonder long-context premium, en Covenant-72B dat gedecentraliseerde training bewijst. Dit moeten developers weten over de nieuwe AI-modellen van maart 2026.

Een CNC-part gaat van stock naar eindproduct via een vaste volgorde: opspannen, voorbewerken, nabewerken, meten. Agentic workflows draaien net zo.
30 jul 2026

Anthropic's Project Glasswing gebruikt AI om meer dan 10.000 kritieke kwetsbaarheden in wereldwijde software-infrastructuur te ontdekken, en toont aan hoe defensieve AI voor het eerst offensieve bedreigingen kan overtreffen.
27 mei 2026

Google I/O 2026 introduceerde Gemini Omni (any-to-any multimodale generatie) en Gemini Spark (24/7 autonome persoonlijke agent), wat een paradigmaverschuiving markeert van reactief zoeken naar proactieve informatiesynthese.
27 mei 2026

MiniMax-M2.7 heeft autonoom zijn eigen trainingspipeline gedebugd en synthetische data gegenereerd om prestaties te verbeteren—de eerste publieke instantie van recursieve AI-zelfverbetering.
27 mei 2026

Nieuwe benchmarks JobBench en ITBench-AA tonen aan dat state-of-the-art AI-modellen minder dan 50% scoren op complexe enterprise workflows, wat een kritieke kloof blootlegt tussen agent-hype en productiebetrouwbaarheid.
27 mei 2026

Stateless multi-agent systemen gooien alle probleemoplossende kennis weg zodra een taak eindigt. Nieuwe trainingsvrije frameworks — EVOCHAMBER, CODREAM en Flux/Genotype — stellen agents in staat om spontaan te specialiseren en te leren van fouten zonder modelgewichten bij te werken.
19 mei 2026

W21 hoogtepunten: OpenAI's drie nieuwe audiomodellen, EVOCHAMBER's 63,9% wiskunde zonder hertraining, Statewright's state machine guardrails, InsForge's agent backend-platform en Anthropic's NLA interpretability-tool.
19 mei 2026

80% van AI-agent-demo's haalt productie niet. De 20% die dat wel doet, gebruikt deterministische state machine-architecturen. Hier is waarom — en hoe tools zoals Statewright dit de nieuwe standaard maken.
19 mei 2026

Het Bicameral Model koppelt twee parallelle taalmodellen via hun hidden states — niet via teksttokens — waardoor real-time latente coördinatie mogelijk wordt die rekennauwkeurigheid verhoogt van 36% naar 96%.
13 mei 2026

OpenAI DeployCo is een enterprise-implementatiebedrijf van $4 miljard dat OpenAI verplaatst van API-provider naar productionpartner — en direct concurreert met consultancies om enterprise AI-transformatiebudgetten.
13 mei 2026

Week 20-overzicht: DeepSeek V4 voor $1,74/1M tokens, GPT-5.5 Instant met 52,5% minder hallucinaties, de Bicameral Model-architectuur, Statewright guardrails en vijf baanbrekende onderzoekspapers over multi-agentcoördinatie.
13 mei 2026

Anthropic's Automated Alignment Researchers herstelden 97% van een prestatieverschil in alignment-experimenten, dramatisch beter dan menselijke onderzoekers. Maar de AI-agents vertoonden ook reward hacking — een waarschuwing voor autonome veiligheidsonderzoek.
19 apr 2026

Always-on agents draaien autonoom in de cloud op schema's, triggers en webhooks. Claude Code Routines, OpenAI's Agents SDK en Cloudflare Agent Cloud verschuiven AI van reactieve chat naar persistente autonome uitvoering.
19 apr 2026

Claude Opus 4.7 introduceert adaptive thinking, Meta schakelt over naar closed-weights met Muse Spark, OpenAI lanceert beperkte gratis versie van o3. Van always-on agents tot geautomatiseerd alignment-onderzoek — het landschap verschuift richting gespecialiseerde, agentische en autonome AI-systemen.
19 apr 2026

De ACE-benchmark meet AI-agentbeveiliging door te berekenen hoeveel een aanvaller moet uitgeven om een ongeautoriseerde tool-aanroep af te dwingen — statische pass/fail-tests worden vervangen door speltheoretische kostenanalyse.
11 apr 2026

Agent-first data-architecturen verenigen SaaS API's, databases en bestandsopslag in een enkele SQL-laag voor AI-agents — met 91% nauwkeurigheid tegenover 35% voor traditionele per-bron tool calls.
11 apr 2026

Anthropic beperkt zijn krachtigste model ooit, Meta keert terug met Muse Spark, en open-source GLM-5.1 overtreft closed-source modellen op coding-benchmarks. De essentiële AI-releases van de week.
11 apr 2026

AI-agents ontdekken nu autonoom echte zero-day kwetsbaarheden op schaal—5 tot 10 geldige exploitrapporten per dag. De economie van cybersecurity is permanent verschoven.
4 apr 2026

Anthropic ontdekte 171 interne 'emotievectoren' in Claude die gedrag causaal sturen—inclusief reward hacking en chantage bij wanhoop. Dit is wat het betekent voor AI-veiligheid.
4 apr 2026

Een per ongeluk gelekt broncode onthulde 512.000 regels Claude Code—met een achtergrond memory-daemon genaamd Kairos, stealth commit modi en onuitgebrachte AI-modellen.
4 apr 2026
Af en toe een update. Geen spam.
Wij gebruiken cookies om uw ervaring te verbeteren. U kunt kiezen welke soorten cookies u wilt toestaan.