3min Analytics

AWS laat Aurora rechtstreeks data uit S3 analyseren

AWS laat Aurora rechtstreeks data uit S3 analyseren

AWS breidt Aurora PostgreSQL uit met DuckDB, waardoor gebruikers vanuit de database rechtstreeks historische gegevens in Amazon S3 kunnen analyseren. Daarmee wil AWS voorkomen dat organisaties data eerst moeten kopiëren voordat operationele en historische gegevens gezamenlijk kunnen worden bevraagd.

De nieuwe functie richt zich volgens The Register vooral op omgevingen waarin actuele transactiedata moet worden gecombineerd met grote hoeveelheden oudere gegevens. Tot nu toe waren daarvoor vaak datapijplijnen nodig die informatie vanuit S3 naar een database brachten. Dat kost niet alleen extra opslag- en rekenkracht, maar maakt het ook noodzakelijk verschillende kopieën van dezelfde gegevens synchroon te houden.

Aurora PostgreSQL kan voortaan rechtstreeks gegevens benaderen die zijn opgeslagen in Apache Iceberg- en Parquet-formaat. Daarbij wordt DuckDB ingezet om de analytische verwerking binnen Aurora uit te voeren. Applicaties kunnen daardoor via bestaande PostgreSQL-interfaces queries uitvoeren waarin reguliere Aurora-tabellen en gegevens uit een data lake worden gecombineerd.

DuckDB krijgt snel plek binnen AWS

De integratie volgt kort op de overname van DuckLabs door AWS. Het bedrijf achter DuckDB werd vorige maand ingelijfd. DuckDB is een opensource analytische database die is ontworpen om rechtstreeks binnen andere software te draaien. Dat maakt de technologie geschikt voor het analyseren van grote datasets zonder daarvoor een afzonderlijk databasesysteem op te zetten.

AWS lijkt DuckDB nu snel een bredere rol binnen zijn platform te geven. Bij Aurora moet de technologie vooral voorkomen dat analytische queries eerst via andere diensten of infrastructuur moeten lopen. Dat vermindert het aantal netwerkstappen en maakt het mogelijk één query te gebruiken voor zowel actuele als historische data.

AWS ziet onder meer toepassingen bij realtime dashboards en transacties die met historische informatie worden aangevuld. Ook AI-agents worden nadrukkelijk als usecase genoemd. Bij dergelijke agents is vooraf niet altijd bekend welke gegevens ze tijdens een taak nodig hebben. Het vooraf kopiëren van alle mogelijk relevante datasets is daardoor moeilijk schaalbaar.

Data blijft in S3

Aurora probeert tijdens queries alleen de benodigde gegevens en kolommen uit S3 te lezen. Veelgebruikte data kan bovendien in de cache worden geplaatst. Ontwikkelaars krijgen inzicht in onder meer het aantal gescande rijen, de hoeveelheid uit S3 gelezen data en cache-hits.

AWS demonstreert de werking met een financiële toepassing. Daarbij werden zeven dagen aan recente transacties in Aurora gecombineerd met vijf jaar historische transactiedata in een Parquet-bestand op S3. Aurora kon het schema van het bestand automatisch uit de metadata afleiden.

Voor toepassingen waarbij een responstijd van enkele milliseconden noodzakelijk is, blijft het mogelijk geselecteerde data naar native Aurora-tabellen te kopiëren. Analytische leesopdrachten kunnen daarnaast naar een read replica worden gestuurd, zodat ze de operationele database minder belasten.

Externe Iceberg-catalogi worden eveneens ondersteund. Die kunnen via AWS Glue aan Aurora worden gekoppeld, waarna PostgreSQL-applicaties tabellen uit verschillende catalogi in dezelfde query kunnen gebruiken.

De functionaliteit wordt beschikbaar via de extensie aurora_analytics en werkt met Aurora PostgreSQL 17.11 en 18.6 en latere versies. AWS brengt geen afzonderlijke prijs voor de functie in rekening. Het gebruik kan wel leiden tot hogere kosten voor Aurora-rekenkracht en voor het uitlezen van gegevens uit S3.