onderzoeksbrief · 2026-07-27
NL EN

Thor Lab Onderzoeksbrief: Week 31, 2026

Gebouwd 2026-07-28 uit monitors/research_report.md (maandagscan 2026-07-27 09:34)
5topkeuzes
10eervolle vermeldingen
45achtergrond
2aannamevlaggen
Deepthink samenvatting: Een grote week voor agentcapaciteit. Claude Opus 5 verschijnt als de nieuwe ruggengraat voor de orchestrator, en SceneActBench geeft het lab een echte meetlat voor agents die handelen in 3D-scenes. Beide duwen de SIMA-achtige autonome loops vooruit. Daarnaast schetsen twee 3D-Gaussian-splat-papers (TopoGS en Points as Tori) een geloofwaardige route om het kwetsbare meshen over te slaan en ruwe scans rechtstreeks de fysica-solvers in te sturen.

Aannames die uitdaging verdienen

Top 5 — Deepthink-selectie

Een centrale orchestrator-breincube verbonden met drie satelliet-workermodules met een stabiele context van een miljoen tokens en een versiebadge v0.120.0
#1AGENT_TOOLING

Anthropic SDK v0.120.0 — release van Claude Opus 5

GitHub Release [Anthropic SDK]
Kernbijdrage
Levert Claude Opus 5 via de Anthropic SDK, een stap vooruit in redeneerkwaliteit voor de taalmodel-ruggengraat waar het lab op bouwt.
Hoe Thor het gebruikt
De hoofd-orchestrator-agent in de multi-entity-pijplijn kan van Opus 4.7/4.8 naar Opus 5. Dat verhoogt het vermogen van de agent om lange autonome onderzoeksloops bij elkaar te houden en cross-entity-verificatie te draaien zonder achteruit te gaan over een lang contextvenster.
Volgende actie
Bump de SDK naar v0.120.0 en draai een gelijke-voor-gelijke A/B: Opus 5 tegen het huidige Opus 4.8-brein op een echte labtaak (een STAR-CCM+-macro schrijven, of een CFD-goedkeuringsoordeel), want het is gratis voor ons op het Max-plan. Houd het snellere model voor interactieve beurten tot de vertraging gemeten is.
Blokkades
Bevestig of Opus 5 rate limits of promptopmaak verschuift ten opzichte van de 4.x-lijn. Praktijkreviews melden dat het het traagste frontier-model is, dus latentie, niet kosten, is het punt om op te letten.
Waarom dit ertoe doet: de orchestrator is het ene onderdeel waar elke labloop doorheen loopt. Een kwaliteitssprong daar werkt overal door, en omdat we Opus tegen nul marginale kosten gebruiken, geldt het gebruikelijke bezwaar "te duur" niet. De open vraag is puur kwaliteit-per-uur.
Een ruwe puntenwolk en Gaussian-splat van een gebouwmaquette die rechtstreeks verandert in een gladde signed-distance-field-schil met de driehoeksmesh-stap doorgestreept
#23D_SCAN

Points as Tori: Fast Pointwise Signed Distance for Point Clouds

arXiv [Graphics]
Kernbijdrage
Berekent een snel puntsgewijs signed distance field rechtstreeks uit puntenwolken en 3D-Gaussians, zonder expliciet oppervlaktemeshen ertussen.
Hoe Thor het gebruikt
Dit richt zich op precies het 3DGS-naar-fysica-knelpunt in de Seen2Scene-pijplijn. In plaats van kwetsbare Poisson-mesh-completering wordt een ruwe scan van een architectuurmaquette een SDF die vrijwel meteen de LBM- of CFD-solver in kan.
Volgende actie
Implementeer de Points-as-Tori-SDF als een eigen geometrie-preprocessor voor de FluidX3D-datafabriek en vergelijk waterdichtheid en getrouwheid met de huidige meshroute op een stedelijke scan.
Blokkades
De getrouwheid op ruizige, drukke stedelijke puntenwolken moet empirisch getoetst. Een SDF die snel maar fout is bij gevelranden zou het windveld stilletjes verpesten.
Waarom dit ertoe doet: meshen is de meest kwetsbare, meest handmatige stap tussen een scan en een solve. Die volledig weghalen zou de hele scan-naar-simulatie-loop verkorten en een terugkerende bron van geometriefouten wegnemen.
Een meertraps retrieval-augmented agent leest een documentatiebibliotheek en corrigeert een rode foutvlag op een CFD-invoerdeck tot deze groen convergeert
#3STARCCM_AIJ

IteraSim RAG: A Multi-Stage Retrieval-Augmented Agentic Back-End for OpenFOAM-Based CFD

arXiv [Fluid Dynamics]
Kernbijdrage
Een meertraps retrieval-augmented agentarchitectuur, gebouwd om multi-directory CFD-invoerdecks te configureren en fouten zelf te corrigeren.
Hoe Thor het gebruikt
Het is geschreven voor OpenFOAM, maar het meertraps-validatiepatroon past netjes op de STAR-CCM+-autonome loops van het lab. Het is een blauwdruk voor het twee-lagen-faalgeheugen-schema dat URF-, mesh- en convergentieproblemen oplost zonder mens in de loop.
Volgende actie
Pas de IteraSim-meertraps-RAG-promptstrategie aan tot een eigen MCP-server voor de STAR-CCM+-Java-macrogenerator, met het geverifieerde-API-corpus als retrieval-bron.
Blokkades
De RAG-chunking-strategie is afgestemd op OpenFOAM-dictionaries en moet heringericht worden voor het STAR-CCM+-21.02-Java-API-oppervlak, waar LLM-aannames aantoonbaar fout zijn.
Waarom dit ertoe doet: het lab draait al een Qwen-genereert / Opus-oordeelt macroloop. Een gepubliceerd meertraps-RAG-plus-faalgeheugen-patroon is een kant-en-klaar sjabloon om die loop zijn eigen convergentiefouten te laten oplossen in plaats van ze elk te escaleren.
Een ruizige Gaussian-splat-gevel links die rechts verscherpt tot een schone topologie-bewuste reconstructie met vlakke muren en scherpe randen
#43D_SCAN

TopoGS: Planar Reconstruction via Topology-aware 3D Gaussian Splatting

arXiv [Graphics]
Kernbijdrage
Bakt vlakke en topologische randvoorwaarden in 3D Gaussian Splatting zodat architectuuroppervlakken coherent en vlak uitkomen in plaats van wazig.
Hoe Thor het gebruikt
Het lab heeft metrisch-nauwkeurige stedelijke geometrie nodig. De Gaussians dwingen de vlakke aard van gebouwgevels te respecteren zou scans van de Gemini 335L moeten verscherpen tot schone muren en randen voor wind- en zonsimulatie stroomafwaarts.
Volgende actie
Draai TopoGS op een recente maquettescan en vergelijk gevelvlakheid en randscherpte met de huidige WildDet3D / SAM 3.1-route.
Blokkades
Afhankelijk van het uitkomen van de open-source-implementatie en of die schoon bouwt op de Blackwell-GPU (sm_120, CUDA 12.8).
Waarom dit ertoe doet: zachte, wiebelige gevels zijn de belangrijkste reden dat een splat-scan niet te vertrouwen is als CFD-invoer. Vlakheid afdwingen waar de wereld daadwerkelijk vlak is, is de goedkoopste route naar metrische geometrie die de solver accepteert.
Een vision-language-agentoog reikt met tool-use-pijlen in een kleine 3D-stadscene om gebouwen te verplaatsen en te bevragen, beoordeeld door een benchmark-meter
#5AGENT_TOOLING

SceneActBench: Can Agents Act on the 3D Scenes They See?

arXiv [Computer Vision] · ook op HuggingFace Papers
Kernbijdrage
Een benchmark voor hoe goed vision-language-modellen daadwerkelijk tools kunnen gebruiken om te manipuleren en redeneren binnen 3D-scenes, niet alleen ze beschrijven.
Hoe Thor het gebruikt
Het lab bouwt SIMA-achtige agents die redeneren over stedelijke 3D-geometrie, bijvoorbeeld beoordelen welke gebouwen windhinder domineren. SceneActBench is een standaardmanier om het ruimtelijk tool-gebruik van de Angelo-agent (Gemini 3.1 Pro) te scoren voordat die in de live planner gaat.
Volgende actie
Download de SceneActBench-dataset en meet de basislijn van het 3D-ruimtelijk redeneren van de huidige multi-entity-verifier-agent erop.
Blokkades
Geen verwacht. arXiv-paper met een bijbehorende HuggingFace-Papers-vermelding; datasetbeschikbaarheid te bevestigen.
Waarom dit ertoe doet: het lab vraagt agents steeds om te handelen op geometrie en beoordeelt het resultaat vervolgens op gevoel. Een gepubliceerde benchmark voor handelen in 3D-scenes is de objectieve basislijn die "de agent lijkt de locatie te begrijpen" in een getal verandert.

Overige eervolle vermeldingen

Agentic Context Management: Solving Agent Memory and Cost as Lifecycle and Architecture Problems
HuggingFace Papers · AGENT_TOOLING · Flash 92 — context- en geheugenbeheer is de kernhindernis voor langlopende autonome onderzoeksloops.
Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making
HuggingFace Papers · AGENT_TOOLING · Flash 88 — uniforme latente sturing voor tool-gebruik versus direct antwoorden past op de orchestrator/verifier-splitsing.
SiPhy: Single-Image Physical Property Reasoning
arXiv [Computer Vision] · MULTISOLVER_PLANNER · Flash 88 — fysische eigenschappen afleiden uit een enkel beeld voedt de proactieve beeld-naar-simulatie-pijplijn.
A hybrid physics-based and data-driven framework for spatiotemporal prediction of urban microclimate across climate zones
Building & Environment · SURROGATE_NN · Flash 88 — hybride fysica-datavoorspelling van microklimaat sluit aan bij de Transolver/GeoTransolver-datafabrieksdoelen.
Offline Vision-Language Navigation with Geometric Goal Localization for Outdoor Environments
arXiv [Robotics] · 3D_SCAN · Flash 88 — koppelt metrische LiDAR-geometrie aan geprompte segmentatie voor buiten, metrisch-nauwkeurige stedelijke reconstructie.
SM4RT: Learning Structured Motion Geometry for 4D Reconstruction
arXiv [Computer Vision] · 3D_SCAN · Flash 85 — 4D-bewegingsgeometrie en monoculaire reconstructie ondersteunen de Seen2Scene- en perceptiefusie-stack.
JustDepth: Real-Time Radar-Camera Depth Estimation with Single-Scan LiDAR Supervision
arXiv [Computer Vision] · 3D_SCAN · Flash 85 — nauwkeurige metrische diepte is cruciaal voor het scannen van maquettes en locaties als CFD-invoer.