---
title: "Reconstructed Slides: Optimizing inference for voice models in production - Philip Kiely, Baseten"
category: "slides"
video_id: "gmTHs5T_YAE"
sourceLabels: ["Cropped public YouTube video frames", "Local OpenCV slide-region detection", "Local RapidOCR"]
---

# Reconstructed Slides: Optimizing inference for voice models in production - Philip Kiely, Baseten

## Source Video
[Optimizing inference for voice models in production - Philip Kiely, Baseten](https://www.youtube.com/watch?v=gmTHs5T_YAE)

## Method
This deck is reconstructed from the existing video frame captures by detecting likely slide regions with OpenCV, cropping/upscaling those regions, deduplicating similar crops, and OCRing the cropped slide images locally. It is a cleaner companion to the full-stage frame deck.

## Reconstructed Slides
![[assets/reconstructed-slides/gmTHs5T_YAE/slide-001.jpg]]

- Source frame: `slide-001.jpg`
- Crop: `full` `[0, 0, 960, 540]` score `160.12`
![[assets/reconstructed-slides/gmTHs5T_YAE/slide-002.jpg]]

- Source frame: `slide-002.jpg`
- Crop: `full` `[0, 0, 960, 540]` score `177.23`
![[assets/reconstructed-slides/gmTHs5T_YAE/slide-003.jpg]]

- Source frame: `slide-003.jpg`
- Crop: `full` `[0, 0, 960, 540]` score `176.32`
![[assets/reconstructed-slides/gmTHs5T_YAE/slide-004.jpg]]

- Source frame: `slide-004.jpg`
- Crop: `full` `[0, 0, 960, 540]` score `177.28`
![[assets/reconstructed-slides/gmTHs5T_YAE/slide-005.jpg]]

- Source frame: `slide-005.jpg`
- Crop: `full` `[0, 0, 960, 540]` score `176.87`
![[assets/reconstructed-slides/gmTHs5T_YAE/slide-006.jpg]]

- Source frame: `slide-006.jpg`
- Crop: `full` `[0, 0, 960, 540]` score `163.67`
## Dense Scene-Detected Slide Candidates
- [[youtube-gmTHs5T_YAE-dense-slides]]
