---
title: "Slides: Your realtime AI is ngmi — Sean DuBois (OpenAI), Kwindla Kramer (Daily)"
category: "slides"
video_id: "E71YtNbCFXY"
sourceLabels: ["Public YouTube video frames", "Public YouTube metadata"]
---

# Slides: Your realtime AI is ngmi — Sean DuBois (OpenAI), Kwindla Kramer (Daily)

## Source Video
[Your realtime AI is ngmi — Sean DuBois (OpenAI), Kwindla Kramer (Daily)](https://www.youtube.com/watch?v=E71YtNbCFXY)

## Relationship To World's Fair 2026
These slides are extracted from a public AI Engineer YouTube video connected to World's Fair 2026. Speaker-matched clips are supporting context unless later confirmed as exact session recordings; official livestream recordings are day-level/event-level source material.

## Related Scheduled Sessions
- No individual scheduled session mapping has been assigned yet; treat this as an event livestream deck.

## Extracted Slides
![[assets/slides/E71YtNbCFXY/slide-001.jpg]]

OCR text:

> INNOVATIONPARTNER
> aws
> PLATINUMSPONSORS
> Graphite
> WWindsurf
> MongoDB
> daily
> augment code
> Workos

![[assets/slides/E71YtNbCFXY/slide-002.jpg]]

OCR text:

> et
> re wx 7 ;
> ; ae
> 
> | ‘ ~~>
> 
> M 3 2 Lo )
> 
> an” \ ¢
> a — 4
> : Ae ~ we

![[assets/slides/E71YtNbCFXY/slide-003.jpg]]

OCR text:

> _

![[assets/slides/E71YtNbCFXY/slide-004.jpg]]

OCR text:

> 500 milliseconds is a typical voice-to-voice latency during a
> human conversation
> AN[LOA|PAL] a evveeeeeeeees [Lada] te
> Lo
> EASE ct NEP Andean at v ee oe et
> BLaTee Voice-to-Voice pelt
> latency
> 5 ci z @ daily
> ee — , rai)
> e a Microsoft Gm)

![[assets/slides/E71YtNbCFXY/slide-005.jpg]]

OCR text:

> Always has been.
> a ¥ Bluetooth is y, :
> 3 a problematic? eas oS
> Yas {fii
> ao
> Ve a = ae a
> ‘ ‘\
> ; ry ™
> <a aws
> & P , ds

![[assets/slides/E71YtNbCFXY/slide-006.jpg]]

OCR text:

> lf you only remember
> one thing ...
> Use WebSockets for
> server-to-server connections
> Perce ry
> Twilio server @ Pipecat bot
> Pipecat bot < speech-to-speech API
> ry atency
> x a 6
> ya: Tcl ES IOOL

![[assets/slides/E71YtNbCFXY/slide-007.jpg]]

OCR text:

> .. let you write simpler code
> WebSockets WebRTC
> [aie] 227 lines of code 27 lines of code
> atency y ceciyd
> me
> baat mo ; .
> ee makes aS 600 OO
> X ry :

![[assets/slides/E71YtNbCFXY/slide-008.jpg]]

OCR text:

> > Fd
> 
> .
> 
> &*
> 
> Fe |
> 
> mi

![[assets/slides/E71YtNbCFXY/slide-009.jpg]]

OCR text:

> rf
> 
> wd
> 
> ow.
> 
> ‘a

![[assets/slides/E71YtNbCFXY/slide-010.jpg]]

OCR text:

> ~- _ A cs pan ;
> 
> | f. <a
> 4
> i aI ,

![[assets/slides/E71YtNbCFXY/slide-011.jpg]]

OCR text:

> AIE
> aws

![[assets/slides/E71YtNbCFXY/slide-012.jpg]]

OCR text:

> AI Engineer
> World's Fair

## Slide-Derived Subjects To Review
Subject extraction uses video title, related session titles/descriptions, transcript context, and OCR text when available. OCR is best-effort and should be reviewed against the embedded slide images.
